학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 roc_auc_score 가 평가지표로 지정된 분류문제에서 rf.fit(X_tr, y_tr)로 학습하고 pred= rf.predict_proba(X_val) 로 pred를 만든 후 from sklearn.metrics import roc_auc_score roc_auc_score(y_val, pred[:,1]) << 이 부분과 pred=rf.predict_proba(test) result= pd.DataFrame({'pred': pred[:,1]}) << 이 부분 이렇게 딱 두 파트에서만 쓰이는 게 맞나요? 기출 3회 노트에서는 pred = rf.predict_proba(X_val)[:,1] 과 roc_auc_score(y_val, pred) 그리고 pred = rf.predict_proba(test)[:,1] 이렇게 쓰셨는데 시나공 교재에서는 제가 위에 썼던 것처럼 풀이가 돼있습니다
pred = rf.predict(test) result = pd.DataFrame({"pred" : pred}) result.to_csv("result.csv",index = False) pred = rf.predict(test) submit = pd.DataFrame({"pred" : pred}) submit.to_csv("result.csv",index = False) pd.read_csv로 찍어보면 두 코드다 동일한 결과를 보이는데 마지막 제출단계에서 아래 코드 submit 말고 위에 코드 처럼 result를 사용해서 제출해도 상관 없을까요?
작업형 3유형에서 강의의 예시 문제들은 어떤 검정이다라는게 제목으로 있는데 실제 문제에서도 단일표본검정이다 독립표본검정이다 이런것을 알려주나요? 실제 체험환경에 문제를 보면 이건 없는거 같아서요. 문제를 보고 어떤 검정을 해야 하는지 판단하는게 맞지요? 혹시 이럴때 어떤 검정을 해야 하는지 뭘 보고 어떻게 판단하면 좋을까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 선생님께서 컬럼의 수가 많으면 원핫인코딩시 자료가 너무나 방대해진다고해서 해당 문제에서 ((4198, 21), (1499, 20)) 다음과 같이 컬럼의 수가 많아 라벨인코딩을 하려했습니다 그런데 선생님은 원핫인코딩을 하셨더라구요? 그렇게 해도 되는건가요? 그리고 제가 궁금해서 원핫인코딩후의 shape를 찾아보니 (4198, 29) (1499, 29) 으로 컬럼의 수가 별로 안늘어났는데 왜 이런거죠?? 알려주시면 감사하겠습니다 ㅠㅠ
target = train.pop('target') cols = ['gender', 'enrolled_university', 'education_level', 'major_discipline', 'experience', 'company_size' , 'company_type', 'last_new_job'] for col in cols: train[col] = train[col].fillna(train[col].mode()[0]) test[col] = test[col].fillna(test[col].mode()[0]) from sklearn.preprocessing import LabelEncoder cols2 = train.select_dtypes(include='O').columns for col in cols2: le = LabelEncoder() train[col] = le.fit_transform(train[col]) test[col] = le.transform(test[col]) # 결측치 처리 train = train.fillna("X") test = test.fillna("X") # train과 test 합쳐서 원핫인코딩 combined = pd.concat([train, test]) combined_dummies = pd.get_dummies(combined) n_train = len(train) train = combined_dummies[:n_train] test = combined_dummies[n_train:] 저는 위의 방식으로 풀었고 풀이는 아래 방식으로 풀었는데, result.csv에서 roc_auc 결과를 비교하면 많이 다르게 나타납니당... 예를 들어 같은 인덱스임에도 제 방식에서는 roc_auc가 0.2로 나오는데 풀이에서는 0.02가 됩니다. 이 경우에는 풀이에 따라서 0,1로 완전히 다르게 인식되는데도 점수 받는데 상관이 없을까요..?
작업형2 이진분류 문제에서 평가지표로 roc_auc_score을 주고, pred결과 예시는 A,B와 같은 문자로 제시되어있는 경우에 model.predict_proba을 제출하는게 아니라 model.predict을 제출해야 되는건가요? 강의 1회독할 때 위와같은 경우에도 확률값을 나타내는 predict_proba 을 그대로 제출해도 된다들었는데, 알려주시면 감사하겠습니다! ( 직전에 동일한 질문올렸는데, 이상하게 질문이 삭제가 되어서 다시 올립니다.)
target값 분리를 하여 진행하는 경우에는 스케일링 전에 하면 되는지 후에 하면 되는지 궁금합니다 원핫인코딩을 하는 경우에는 수치형과 범주형을 구분하지 않아도 된다고 하셨는데 라벨인코더를 사용하는 경우에도 일치 할까요 ? 또한 추가적으로 minmax와 같은 수치형 스케일링이 필수적인지도 여쭤보고 싶습니다 ,,, ! 선택인 경우에는 어떤 경우에 하면 될지도 궁금합니다
안녕하세요 강사님 강의를 수강하는 학생입니다. 무한 스크롤링은 두 번째부터 보통 끝쪽 id 에 데이터를 기반으로 데이터를 불러오는 방식이 보통 커서 기반 페이지네이션과 큰 차이가 없는 건가요? (claude 나 ) 블로그 보면서 이것도 비슷한 개념인 거 같아서 질문 드립니다. @Entity @Table( name = "post", indexes = { @Index( name = "idx_post_board_created_id", columnList = "board_id, created_at DESC, post_id DESC" ), @Index( name = "idx_post_created_id", columnList = "created_at DESC, post_id DESC" ) } ) @Getter @NoArgsConstructor public class Post { @Id @GeneratedValue(strategy = GenerationType.IDENTITY) @Column(name = "post_id") private Long id; @ManyToOne(fetch = FetchType.LAZY) } 이렇게 엔티티에 인덱스를 만들어서 사용하는지 궁금합니다. 강의에서 처럼 SnowFlake도 보통 저렇게 인덱스를 만들어서 활용하는지도 궁금합니다.
[작업형2] 연습문제 섹션 3 Section 3. 항공권 가격 예측에서 문제 풀이를 보면 train = train.drop('flight', axis=1) test = test.drop('flight', axis=1) 원핫인코딩을 하면 컬럼수가 많아서져 flight를 삭제한다고 되어 있습니다.(기본에서요) 그런데 이해가 안되는게...flight 의 가격을 예측하는건데 이것을 삭제하고 모델을 학습 시킨다는게 이해가 안되거든요...
random_state=0을 아래에서 처럼 분리할때랑 , 학습할때 총 두번넣어줘도 상관없을까요? # 검증용 데이터 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size= 0.2 , random_state = 0 ) # 모델 학습 및 평가 from sklearn.ensemble import RandomForestRegressor model = RandomForestRegressor(random_state=0) model.fit (X_tr, y_tr) pred = model.predict(X_val)