import pandas as pd train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p2/heart/2files/train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p2/heart/2files/test.csv") # train = pd.read_csv("train.csv") # test = pd.read_csv("test.csv") print(train.shape, test.shape) target = train.pop('output') from sklearn.model_selection import train_test_split X_tr,X_val,y_tr,y_val = train_test_split(train,target,test_size=0.5,random_state=2022) print(X_tr.shape,X_val.shape,y_tr.shape,y_val.shape) from sklearn.ensemble import RandomForestClassifier model = RandomForestClassifier(random_state=2022,max_depth=5, n_estimators=400) model.fit(X_tr,y_tr) pred = model.predict_proba(X_val) from sklearn.metrics import roc_auc_score roc_auc = roc_auc_score(y_val,pred[:,1]) print(roc_auc) 작업형2 3번 예시 문제에서 강의 스크립트와 동일하게 작성했는데 roc_auc 평가 결과가 1.0으로 나오게 됩니다. 1로 나오는 결과는 모델이 검증 데이터를 완벽하게 예측하는 경우라고 하는데, 해당 스크립트 맞는지 한번 봐주시면 감사하겠습니다!^^
안녕하세요 쿠케님. 우선 좋은 강의 감사합니다. 다름이 아니라 댓글 무한 depth - 테이블&구현 설계에서 unique index를 작성하는 부분이 나오는데 unique index 대신 index로 구현하고 table 생성 시 path에 unique 제약을 걸어도 효과가 같을지 궁금합니다.
문제를 라벨인코딩이 아닌 원핫인코딩으로 풀고 싶은데, 챗 gpt 에 물어봤더니, # 열 정렬/맞춤 필수 (시험 감점 포인트!) train, test = train.align(test, join='left', axis=1, fill_value=0) 이 코드가 필수라고 해서요! 원핫인코딩을 할 떄는 항상 안전하게 이 코드를 작성해주면 좋을까요? 아니면 이 문제의 경우 특히 그런걸까요?
저는 1.데이터 크기 확인 print(train.shape,test.shape) 2.결측치 수 print(train.isnull().sum()) print(test.isnull().sum()) 3.#target unique 수 print(train['Heat_Load'].value_counts()) 4.데이터 정보(자료형) print( train.info ()) 정도만 확인 하는데 value_counts()로 확인하는 이유와 object의 unique개수를 확인 하는 이유가 뭔가요?
안녕하세요. 3유형 관련하여, 문제가 주어지면 알아서 독립성/정규성/등분산성 까지 검증을 해야하는지 궁금합니다~! 예를 들면 예) 과자의 무게는 200g과 다른지 검정하세요. 1.정규성 검정 (shapiro) 이후 결과에 따라 willcoxon이나 ttest_1samp를 진행해야 하는 것인지. 2.그게 아니라면, 정규성은 주어지고 willcoxon이나 ttest_1samp를 하라고 주어지는 것인지 궁금합니다.
그대로 따라하고 실행했는데 이런 문제점이 있습니다. 왜인지 잘 모르겠어요. 44강에서 테스트 메세지의 링크가 모바일에서도 안나옵니다. 44강에서 위치보기 도 누르면 아무 링크가 안열립니다. 45강에서 PC카톡에 "안녕하세요. 봇입니다." 라는 메세지를 보내면, 계속 이렇게 나오네요.
기출 3회 작업형2 lgbm으로 풀다가 질문드립니다 #lightgbm import lightgbm as lgb rk = lgb.LGBMClassifier(random_state=628, verbose=-1) rk.fit(X_tr, y_tr) 여기까지 했는데 LightGBMError: Do not support special JSON characters in feature name. 이렇게 오류가 뜨는 건 어떻게 해야하는 건가요??
1번 문제가 잘 이해가지 않습니다. 분산에 차이가 있는지 알아본다 ->등분산 검정을 수행하라는 것 같아 반사적으로 levene을 떠올리고 있었는데, 'F-검정을 수행할 때 검정통계랑을 구하라'라는 지문이 이해가지 않아요 검정 통계랑이라는게 각 분산값을 나눈것으로 정의되어 있는건가요? 저렇게 나누는것이 F-검정인가요
수업 듣다가 궁금증이 생겨서 질문드립니다. 가변인자를 쓰면 값의 개수와 상관없이 함수가 실행되는 것 같은데 그러면 가변인자는 항상 함수에서 맨 마지막에 써야 하나요? 예를 들어 profile(name, age, *language, address) 이런식으로 함수를 구성하게 되면, 제가 profile ("유재석", 20, "파이썬", "자바", "C", "서울시") 이렇게 적었을때 어디까지가 language이고 어디부터가 address 인지 모르지 않을까 해서요.