작업형2 이진분류 문제에서 평가지표로 roc_auc_score을 주고, pred결과 예시는 A,B와 같은 문자로 제시되어있는 경우에 model.predict_proba을 제출하는게 아니라 model.predict을 제출해야 되는건가요? 강의 1회독할 때 위와같은 경우에도 확률값을 나타내는 predict_proba 을 그대로 제출해도 된다들었는데, 알려주시면 감사하겠습니다! ( 직전에 동일한 질문올렸는데, 이상하게 질문이 삭제가 되어서 다시 올립니다.)
target값 분리를 하여 진행하는 경우에는 스케일링 전에 하면 되는지 후에 하면 되는지 궁금합니다 원핫인코딩을 하는 경우에는 수치형과 범주형을 구분하지 않아도 된다고 하셨는데 라벨인코더를 사용하는 경우에도 일치 할까요 ? 또한 추가적으로 minmax와 같은 수치형 스케일링이 필수적인지도 여쭤보고 싶습니다 ,,, ! 선택인 경우에는 어떤 경우에 하면 될지도 궁금합니다
[작업형2] 연습문제 섹션 3 Section 3. 항공권 가격 예측에서 문제 풀이를 보면 train = train.drop('flight', axis=1) test = test.drop('flight', axis=1) 원핫인코딩을 하면 컬럼수가 많아서져 flight를 삭제한다고 되어 있습니다.(기본에서요) 그런데 이해가 안되는게...flight 의 가격을 예측하는건데 이것을 삭제하고 모델을 학습 시킨다는게 이해가 안되거든요...
random_state=0을 아래에서 처럼 분리할때랑 , 학습할때 총 두번넣어줘도 상관없을까요? # 검증용 데이터 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size= 0.2 , random_state = 0 ) # 모델 학습 및 평가 from sklearn.ensemble import RandomForestRegressor model = RandomForestRegressor(random_state=0) model.fit (X_tr, y_tr) pred = model.predict(X_val)
[작업형2] 연습문제 섹션 4 에서 train과 test를 합하고 나눌때 저는 iloc을 사용했는데 문제 풀이는 iloc을 사용 안 했더라구요. 이전? 강의들에서는 사용했던거 같은데... 그런데 둘 다 오류는 안나도 답이 나오긴 한네요. 무슨 차이 일까요? 제 코드.. df = pd.concat([train,test]) df = pd.get_dummies(df) train = df.iloc[:len(train)] test = df.iloc[len(train):] 강의 코드 # train과 test 합쳐서 원핫인코딩 combined = pd.concat([train, test]) combined_dummies = pd.get_dummies(combined) n_train = len(train) train = combined_dummies[:n_train] test = combined_dummies[n_train:]
(네트워크 필터 설정을 잘못했던 게 문제였습니다. 😂 감사합니다.) 안녕하세요, 이정환 강사님. 강의 잘 듣고 있습니다. (6.10) 비밀번호 재설정 구현 강의에서, 인증 메일 주소를 복사해서 붙여넣기 하니까 Network 탭에 해당 리퀘스트만 들어오고 'verify~'로 시작하는 리퀘스트는 없더라구요. 링크에 접속했을 때 리디렉션은 잘 됩니다. 200 ok인 걸로 봐서 정상 작동하는 것 같긴 한데, 문제가 있는 걸까요? 감사합니다.
문제3에서 주어진 내용이 시험과 동일한건가욥?? 주어진 데이터에서 ‘co’와 ‘nmhc’ 컬럼을 각각 Min-Max 스케일링하시오. 스케일링된 ‘co’, ‘nmhc’ 컬럼의 표준편차를 각각 구하시오. ‘co’ 컬럼의 표준편차에서 ‘nmhc’ 컬럼의 표준편차를 뺀 값을 소수점 3자리로 반올림하여 구하시오. 해당 3.에서 2.와 같이 '스케일링된'이라는 말이 없어서 뜬금 없지만(?) 스케일링되지 않은 ‘co’ 컬럼의 표준편차에서 ‘nmhc’ 컬럼의 표준편차를 빼서 출력했는데 이렇게 명확한 형용사가 없어도 앞 내용에 맞게 생각해서 출력해야 할까요??
연습 문제 6에서는 다수의 범주, 수치형 컬럼에 결측치가 있는데, 최빈값, 중앙값이 아닌 특별히 범주형은 X로 수치형은 -1 으로 결측치를 채운 이유가 있을까요? RandomForest은 결측치가 마킹을 해도 어느정도 학습이 가능하다고 알고 있는데, 다른 모델들도 마찬가지로 X, -1으로 마킹해도 학습이 가능한걸까요? 아니면 RandomForest만의 장점인가요?
저만 이런걸 수 있지만... 결과 화면 보려고 링크 썼더니 이렇게 나옵니다. 10장( https://browser.engineering/widgets/lab10-browser.html )은 잘 출력되는 것 같은데... 11장[ 링크 ], 12장[ 링크 ]은 아래 그림처럼 나오네요. 혹시 제가 잘못한 점이 있는지, 있다면 어떤 부분을 수정해야 하는지 알려주세요! 다른 링크가 있다면 같이 안내해주시면 좋을 것 같습니다.