작업형 2유형에서 베이스라인으로 데이터 삭제, 라벨 인코딩, 원핫 인코딩 3가지를 시행 후 정확도가 높은 것을 선택하여 최종 제출했는데요! 반드시 이 3가지를 모두 시행해야만 하는건지 궁금합니다..!! 예를 들어 1가지를 시행했을때 정확도가 몇% 이상 나왔을때 그냥 그대로 제출해도 되는건지 이런 기준이 있는건지 궁금합니다 ㅠㅠ
안녕하세요 시계열 데이터 강의까지 봤는데요 질문드립니다. 질문1. [시계열데이터1 강]13:08 부근.. DateTime4 를 날짜형식으로 변환할때 1) print(df['DateTime4']) 2) df['DateTime4'] = pd.to_datetime(df['DateTime4'], format='%d %m %Y H:M:S') 3) print(df['DateTime4']) 저는 처음에 2)와 같이 작성했는데요 그런데 강의 영상에서도 설명해주시길 format='%d %m %Y H:M:S'을 쓰지 않고 해야 오류없이 정상적으로 되네요 ? 시간 분, 초가있을때는 HMS를 넣어줘야 하는거아니었나요? ? df['DateTime4'] = pd.to_datetime(df['DateTime4'], format='%d %m %Y H:M:S') 이렇게쓰면 오류 가나오는데 ? 굳이 포맷을 사용하면서 에러가 안뜨게하려면 어떻게 작성해야하나요? 질문2. 데이터프레임에서 특정 열을 날짜형식으로 바꾸고 특정 년도를 추출하라고 했을때 정석적인 방법은 알려주신 to_dateTime~ 을 쓰고 dt.year 를 하는것이겟지만 year이 아니라 문법을 모르는 어려운것을 물어볼때 dt.?? 부분이 모르는게 나와 수틀렷을때 쓸수잇는 방법을 알아두는게 좋을것같아서요 -- 날짜변환쓰지않고 데이터프레임상태에서 특정 열에 있는 object 데이터를 object 형식 그대로 왼쪽에서부터 몇글자만 추출하려면 어떻게 하면 될까요? 날짜 메뉴 기타 0 2023.10.23(금) 짬뽕 맛없어 1 2021.05.24(수) 짜장면 맛있어 예를들어 df 데이터가 위와 같을때 때 2021을 그대로 뽑는다면 (df.loc[1,'날짜'])[0:4) 이렇게 쓰면 2021이 그대로 추출되는데요 한개의 칸을 특정해서 추출 하는게아니라 날짜 열을 전부 추출하려면 어떻게 해야할까요? 0 2023 1 2021 이렇게 추출하고싶습니다.
실제 시험 볼 떄, 정규성 검정과 등분산성 검정을 시행하는 코드를 써야하나요? 제 생각으로는 그냥 정규성 검정과 등분산성 검정을 해서 정규성의 유무와 등분산성의 유무만 판단 후, 다시 코드를 지우고 분산분석이나 가설검정 코드만 써주면 될것같은데... 어떻게 해야할까요? 정규성, 등분산성을 검정했다~라는 것도 표현하기 위해 정규성 검정 코드, 등분산성 검정 코드를 써야할까요?
안녕하세요. 선생님. 5-2 강의 내용 중 잘 이해가 되지 않는 것이 있어 질문드립니다. train.nunique()를 통해 나타난 컬럼 중 name, host_name, last_review, host_id 데이터를 삭제하신 이유가 궁금합니다. nunique()함수는 그 컬럼값 중 고유값이 몇 종류나 되는지 알려주는 것으로 알고 있는데, 그 값과 결측치의 개수가 서로 상관이 있어서 그런것인가요? 가령, name같은 데이터는 강의에서 거의 전체 데이터 개수와 nunique함수를 통해 나타난 개수가 별로 차이가 나지 않을 만큼 많기에 지운다고 말씀하셨는데, 이 부분이 잘 이해되지 않습니다.
18분 20초 부분에 랜덤포레스트로 모델을 만드시고 r2 스코어 시행결과 0.0770341 로 나왔습니다. r2 값은 1에 가까울수록 설명력이 높다고 들었습니다. 그렇다면 만드신 랜덤포레스트 결과물로 제출해버리면 채점관들이 "아 r2 점수가 낮으니 이건 설명력이 낮은 모델이군" 으로 생각해서 감점당할 수 도 있나요??
# 포도당을 제외한 이상치, 평균값으로 대체 cols = ['BloodPressure', 'SkinThickness', 'Insulin', 'BMI'] cols_mean = X_train[cols].mean() X_train[cols] = X_train[cols].replace(0, cols_mean) 선생님께서는 이렇게 train 데이터의 결측치만 평균값으로 바꿔주셨는데 X_test도 같이 바꿔줘야 하는게 아닌가 해서 질문드렸습니다. 그리고 만약 바꾸어 주는게 맞다고 하면 밑에 있는 코딩처럼 다시 한번 X_test[cols]값들의 평균을 구한 다음 하는건지 아니면 위에 있는 train 데이터의 cols_mean을 사용하는건지 궁금합니다!! # cols_mean = X_test[cols].mean() # X_test[cols] = X_test[cols].replace(0, cols_mean)
캐글 T1-12 문제에서 100%가 넘는 접종률은 제거 한다고 되어 있는데 위에 df2 = df[1:] 이게 이상치를 제거 하는게 맞는건가요? 처음 실행 했을 때 100이 넘는 값이 나왔고, 실행 할 수록 프린트 되어 나오는 값이 달라집니다. 그리고 저게 이상치를 제거한다는게 맞다면 저 코드(?)의 의미는 무엇인지 궁금합니다 [1:] 이부분이...
5-3 수업 자료에서 train = train.drop('id, axis = 1) test_id = test.pop('id) 를 썻는데 여기 3-5 문제2 에서도 검증데이터 분리 전에 X_train = X_train.drop('id, axis = 1) X_test_id =X_ test.pop('id) 을 쓰고 그대로 진행해도 될런지요?? 진행해보았는데 22222.csv 파일 내용을 보면 강의와는 수치가 조금 다릅니다 id income 11574 0.03 15847 0.01 17655 0.1 19790 0.47 31812 0.05 이런식으로 나오는데 저의 풀이도 맞는지요!
실제 캐글(Kaggle) 문제 풀고, 제출해보며, 성능 개선 기법 익히기2 강의 17:30 부분에서 질문이 있습니다. 이번 강의에서는 transforms.Normalize([0.485, 0.456, 0.406], [0.229, 0.224, 0.225]) 와 같이 이미지 데이터에 Normalization을 적용하였는데요, from transformers import ViTFeatureExtractor feature_extractor = ViTFeatureExtractor.from_pretrained('google/vit-base-patch32-224-in21k') feature_extractor 다음 코드와 같이 vit-base-patch32-224-in21k 모델에서 적용된 image_mean과 image_std를 확인해 보니, "image_mean": [ 0.5, 0.5, 0.5 ], "image_std": [ 0.5, 0.5, 0.5 ] 와 같이 결과가 나왔습니다. 그렇다면, 학습 데이터에 Normalization을 적용할 때에도 [ 0.5, 0.5, 0.5 ], [ 0.5, 0.5, 0.5 ] 값을 적용해야 하는 것이 아닌지 여쭙고 싶습니다. 감사합니다!
안녕하세요 model.fit과 pred사이의 관계 가.. 궁금해져서 질문남깁니다. 처음에 공부할 때는 아무생각 없이 따라쓰면서 'rf.fit에는 x_train, y_train['target'] 변수 두개 넣고 rf.predict에는 x_test 넣어야지' 이렇게만 생각했어요. 근데 이번에 '시험환경에 적응하기'강의에서 문제를 푸는데 궁금한것이 생겼습니다. model.fit (X_train, y_train['gender']) ======1 pred = model.predict_proba(X_test)라고 하잖아요? =====2 이게 X_test는 이제 막 선언(2)했고(이전에 X_test에 대해 뭐 한 게 없는거 같다는 의미로요 - 뭐 한게 있으니까 결과가 저렇게 나오는거 같긴한데 말이죠,, ) 이전에 X_test와는 독립적인 X_train, y_train이 fitting(1)된건데.. 어떻게 X_test라는 변수로만 생긴 pred가 결과적으로 '남자인 확률'을 맞히게 되는건지 ..모르겠습니다. 이 관계를 모르니까 '남자인 확률'을 구하려고 할 때 왜 predict에 X_test['gender']가 아니고 X_test를 넣는지도 모르게 되고 말이죠 근데 결과적으로 pred 나오면 gender에 대한 prediction이 나와요(아마 y_test['gender'] 때문인듯 하지만.. ) 질문이 되게 구구절절인데 요약하자면 model.fit (그리고 그 변수)와 model.prediction(그리고 그 변수)의 관계가 궁금합니다..!! 위 내용은 왜 이게 궁금해지게됐는지에 대한 과정이구요 제가 자체적으로 한 필기에서도 관련 내용을 못 찾겠고 어느 강의에 있을지 찾기 힘들 거 같아 질문으로 올립니다 감사합니다!
코드 답안 작성 시, 암묵적으로 EDA 과정을 거치게 되는데 모의고사 3에서의 EDA는 head(), value_counts(), isnull().sum(), describe()를 사용하여 탐색적 분석을 하게 되는데 이 함수를 실제 시험에서 반드시 써야하는지 궁금합니다(isnull()sum()은 결측치가 있는지 확인하는 함수이니 무조건 사용하여야 할것 같고 value_counts나 describe는 쓰지 않아도 될 것같은 생각입니다)