캐글에 올려주신 자료 중 T1-23 문제를 다시 풀어보고 있는데 선생님 답과 다른 답이 나와서 질문 드립니다. 선생님 풀이와 다른 부분은 10번째 값을 찾는 부분만 다른 코드로 했는데요 10번째 값은 88으로 같은데 중복값 제거 후 f1 중앙값이 75로 선생님 풀이의 값 77과는 다르게 나옵니다. 이유가 뭔지 알 수 있을까요? # f1 결측치를 f1을 내림차순으로 소팅했을 때 10번째 인덱스에 위치한 값으로 채움 df=df.sort_values('f1', ascending=False) df=df.reset_index() # print(df.head(10)) a=df.loc[9,'f1'] print(a) # print(df.isnull().sum()) df['f1']=df['f1'].fillna(a) # print(df.isnull().sum()) # age컬럼의 중복 제거 전 f1중앙값 m1=df['f1'].median() print(m1) # age컬럼의 중복 제거 후 f1중앙값 print(df.shape) df=df.drop_duplicates(subset=['age']) print(df.shape) m2=df['f1'].median() print(m2) print(abs(m1-m2))
상위 10번째 값으로 대체하는 부분에서 df.iloc[:10,-1] = min_value 이렇게 하셨는데 df['views'].iloc[:10]= min_value 이렇게 풀어도 상관없을까요? 만약 2번째 풀이도 상관 없다면 첫번째 풀이로 진행하신 이유가 있을까요? 취향차이일까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 정규성을 만족하지 않을 때 단일 표본과 대응 표본에서 윌콕슨을 사용하려고 합니다. 이때 단일 표본 stats.wilcoxon(df['관측치명']-평균값, alternative=) 라 했을 때 차이로(df['관측치명']-평균값) 계산하였고 대응표본은 차이로 계산이 가능하지만, 더 쉬운 방법인 df['before'], df['after'], alternative= 를 사용하였습니다. 그렇다면 단일표본에서도 df['관측치명'], 평균값으로 계산해서 될까요? 만일 안된다면, 윌콕슨은 차이 값를 기반으로 검정 통계량을 계산하는 것인데 대응표본은 두가지로 가능하면서 단일표본은 무조건 왜 -(차이)를 사용해야 하는지 궁금합니다!
안녕하세요 선생님! 작업형 2유형 확률 문제를 풀다가 결과값 관련해서 문의드립니다 문제에 제시된 pred 예시형태는 소수점 형태인데 제가 코딩해서 제출한 csv 파일을 확인해보면 거의 매번 0 혹은 1로 나옵니다 스케일링은 안하고 object 인코딩만 해주고 있는데 제가 코딩을 잘못 하고 있는 것인지, 채점 관련해서 상관없을지 궁금해서 여쭤봅니다! (roc_auc score는 0.7616337491337491 나왔습니다)
자동차 데이터 셋에서 qsec 컬럼을 Min-Max Scale로 변환 후 0.5보다 큰 값을 가지는 레코드(row) 수는? 문제에서 qsec 컬럼만 묻고 있음 (다른 컬럼 신경 쓸 필요 없음) MinMax Scale 변환 조건 0.5보다 큰 값 제가 짜본 코드입니다. import pandas as pd a = pd.read_csv('/content/mtcars.csv') from sklearn.preprocessing import MinMaxScaler scaler = MinMaxScaler() a['qsec'] = scaler.fit_transform(a[['qsec']]) # ★[['qsec']] cond1 = a['qsec'] > 0.5 print(cond1.sum()) ★ 강의에서는 데이터프레임 형태로 해당위치에 넣어줘야한다는 내용 확인했습니다. 해당 위치에서 대괄호[]를 한번 더 해야하는 이유가 뭔가요? 기존에 제가 받아온 a(mtcars.csv)가 데이터프레임 형태라 그런건가요? 대괄호 [] 1개 - 시리즈, 대괄호 [[[]] 2개 - 데이터프레임
데이터가 충분할 때는 train_test_split으로 X_tr, X_val, y_tr, y_val로 모델을 학습하고, 데이터가 충분하지 않을 때는 cross_val_scores로 모델을 학습한다고 알고 있습니다. 여기서 데이터가 충분하고 충분하지 않고의 기준은 무엇인가요? 데이터가 몇 개의 행이 있어야 충분하다고 보는지 궁금합니다!
안녕하세요 선생님, 보통 작업형2에서 train, val 데이터 분할하고 from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor() rf.fit (X_tr,y_tr) 하고 모델 평가 했을 떄 이상없으면 pred = rf.predict(test) << test를 예측하게 되는데 여기서 질문이, fit은 X_tr, y_tr로 하는게 맞을까요 ? 아님 분할 데이터가 아닌 X_train, X_train[y]로 하는게 더 적합할까요 ?? ㅠㅠ 어렵네여 강의보면 x_tr, y_tr fit해서 진행하긴했는데 궁금합니당
[문제] 결측치가 있는 행을 제거한 후, 학생이 가장 많이 수강한 과목(id_assessment)을 찾고, 해당 과목 점수(score)를 표준화(스탠다스 스케일) 한 뒤에 표준화된 가장 큰 값을 구하시오. (반올림하여 소수 셋째자리까지 계산) 선생님께서는 가장 많이 수강한 과목을 찾기 위해서 value_counts()로 코딩을 하셨는데요! 다름 아니라 df.sort_values('id_assessment' , ascending = False)로 내림차순정렬을 하여서 구하면 안되는걸까요! 내림차순정렬을 할때와 value_counts()로 구할때의 차이점도 혹시 있을까요.. 종종 헷갈리네요.. 둘다 같은 의미일까요 혹시.?