안녕하세요. 이제 막 강의를 듣기 시작했는데요. 혹시 교재는 별도로 판매하시나요? 그리고..지금 커리큘럼에는 작업형 3에 관한 강의는 없는데요. 혹시 나중에 작업형 3에 관한 강의는 업데이트가 되는건가요? 아니면 작업형 3에 관한 것은 새소식에 올려주신 글들을 참고하면 될까요?
roc_auc로 할 때 1) 이진 분류 구할 때(=양성인 확률값을 구하는 것) pred = 모델.predict_proba(X_val) roc_auc_score(y_val, pred[:,1]) pred_final = 모델.predict_proba(X_test) submit = pd.DataFramd({'pred': pred_final[:,1]}) 2) 다중 분류 구할 때(= 각 클래스에 대한 확률값을 구하는 것) pred = 모델.predict_proba(X_val) roc_auc_score(y_val, pred,multi_class='ovr') pred_final = 모델.predict_proba(X_test) submit = pd.DataFramd({'pred': pred_final[:,1]}) => roc_auc를 쓸 때는 predict는 안쓴다고 보면 되는 건가용? => 이 정도만 알면 되는 걸까용?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 Print 구문에서 [cond1]과 [‘views’]의 순서가 왜 이렇게 되는지 궁금합니다. print(df[‘views’][cond1].mean()) 는 안되나요? [] []이 나열되는 기준이 궁금합니다 ㅠㅠ 잘 이해가 안가요… ㅜㅜ
선생님 안녕하세요, ttest의 검정통계량을 구할 때, 입력된 순서에 따라 양수가 나오는경우와 음수가 나오는 경우가 있어 혼동이 되어 질문드립니다. stats.ttest_rel(A,B, alternative = 'less') 와 stats.ttest_rel(B,A, alternative = 'greater')을 같은 의미로 볼 수 있을까요? A와 B의 순서를 바꿔주고 alternative값을 반대로 바꿔준 경우입니다. 이럴경우, t-score가 양수/음수값으로 나누어서 출력되는데, 어떤것이 맞는것인지 질문 드릴 수 있을까요??
슬라이싱 관련 궁금한 점이 생겼는데요 언제 iloc, loc를 사용하는 것일까요? 열을 선택할 때 쓰는 것이라고 생각해왔었는데 pred_proba에서 1일 확률을 선택할 때 iloc를 안 쓰더라구요... model = lgb.LGBMClassifier() model.fit(X_tr, y_tr) pred_proba = model.predict_proba(X_val) pred = model.predict(X_val) print(roc_auc_score(y_val, pred_proba[:,1])) print(accuracy_score(y_val, pred)) print(f1_score(y_val, pred)) submit = pd.DataFrame({ 'id' : id, 'output' : pred_proba[:,1] }) submit.head()
안녕하세요 강사님 타이타닉 작업형2 코드를 작성하던 중 발생한 오류는 아래와 같습니다. 즉, X_train 컬럼 수와 X_test 컬럼 수가 달라 발생한 문제라고 인지하였습니다. 이를 해결하기 위해 강사님 코드를 참고하여 다른 점은 원핫 인코딩 대상 컬럼에 차이가 있었습니다. 저는 원핫 인코딩을 아래와 같이 작성하였으나, 'Ticket', 'Cabin', 'Embarked' 컬럼을 지우니 문제가 해결되었습니다. 'Ticket', 'Cabin', 'Embarked' 컬럼은 범주형 변수인데 원핫인코딩을 하지않고 넘어가는 이유와 위의 변수를 포함하여 원핫인코딩 했을 때 어떠한 이유로 오류가 발생하는지 질문드립니다.. 매번 친절히 답변해주셔서 감사합니다.
안녕하세요!! 작업형 2번 공부하다가 문득 궁금증이 생겨 문의드립니다. model_selection의 train_test_split 이후 (X_train, y_train => X_tr, X_val, y_tr, y_val) RF, Lightgbm, Xgboost 등 여러 모델 테스트 후, 가장 성능 좋은 모델을 선정하여 pred= model.predict(X_test) 이렇게 결과물을 도출하는 과정에서요. 검증단계에서 model.fit (X_tr, y_tr) 이렇게 학습을 진행한 것을 바로 X_test에 predict를 하는데 검증자료로 분할한 X_tr, y_tr이 아닌, 전체 X_train, y_train으로 model.fit(X_train, y_train) 후에 pred= model.predict(X_test) 를 하면 결과가 더 좋을까요? 조금 더 성능을 높일 수 있는 방법인지 궁금해서 문의드립니다!
안녕하세요~ 데이터의 개수를 구할때 len과 sum의 차이가 궁금합니다 ㅠㅠ 예를들어 4회 기출유형 작업형1의 2번문제와 같은경우 문제 : (loves반응+wows반응)/(reactions반응) 비율이 0.4보다 크고 0.5보다 작으면서, type 컬럼이 'video'인 데이터의 갯수 이고, 최종 데이터 개수를 구할때 len 함수를 사용했습니다. 코드 : cond1 =(df['loves'] + df['wows'])/df['reactions'] > 0.4 cond2 =(df['loves'] + df['wows'])/df['reactions'] < 0.5 cond3 = df['type'] =="video" len(df[cond1 & cond2 & cond3]) sum으로는 왜 안되는걸까요? ㅠㅠ 예시는 없지만 작업형1 유형에서 다른 문제는 데이터 개수를 구할때 sum을 사용한적도 있던것 같아서 문의드립니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 3000개 이상의 train 데이터에 대해 EDA할때 describe 함수를 통해 가격(음수가 있으면 안되는) 컬럼에서 - 값이 일부 있다는 것을 발견하면 어떻게 이를 처리하는 것이 좋은지 그 방법, 함수를 알려주시면 감사하겠습니다! 아예 그 행을 삭제하는 것, 음수값을 어떻게 대체할 수있는지 궁금합니다.
안녕하세요! 모의고사 풀어보기2에서 시험환경 체험링크를 통해 하이퍼 파라미터 튜닝 했을때 하기와 같은 에러가 나와 문의드립니다. 그냥 n_estimators 만 썼을때는 나오지 않았던 에러라 뭔가 제가 잘못 코딩한 부분이 있는 것인지 아니면 시험환경에서도 learning_rate 에러가 뜰 수 있는지 문의드립니다. 항상 깔끔한 강의내용 정말 감사드립니다! 코딩내용 : from sklearn.ensemble import RandomForestClassifier model=RandomForestClassifier(random_state=2023,n_estimators=200,learning_rate=0.05) model.fit (X_tr,y_tr) pred_ex=model.predict(X_val) 에러내용 : TypeError: init () got an unexpected keyword argument 'learning_rate'
파이썬 내장함수 사용 시 타입이 데이터프레임이냐 시리즈내에 따라서 사용가능한 함수가 다른 건가요? ex) drop 함수는 데이터프레임만 가능하고, fillna함수는 시리즈만 가능한지? df = df.dropna(subset=['qsec']) df['qsec'] = df['qsec'].fillna(0)