test데이터에 있는 변수가 train에 없을 경우 데이터를 합쳐야한다고 말씀해주셨습니다. test데이에 있는 변수가 train에 있는지 없는지를 확인할 수 있는 코드는 뭐가 있을까요? print(train['칼럼'].value_counts()) print(test['칼럼'].value_counts()) 이 두개로 비교하면 될까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 train.describe()를 찍어봤을 때, 총구매액과 최대구매액의 최솟값이 음수로 나오던데 이 부분은 전처리 하지 않아도 큰 문제는 없을까요? 음수인 값을 0으로만 바꿔줬더니 0.67로 성능이 조금 더 좋아지긴 하더라고요..! 그냥 원본데이터 그대로 제출하는 것이 좋을지, 이 부분도 음수인 값들만 처리해준 다음에 성능만 높아진다면 처리하는 게 좋을지 궁금합니다. 좋은 수업 감사합니다!
좋은 강의 감사드립니다. dir로 목록 찾을때 python문제인지 아니면 원래 출력이 가변적으로 되는지 모르겠습니다. Base 코드 from statsmodels import stats print(dir(stats)) 초기에는 anova, multicomp이 보이지 않습니다. 1. 실행 후 제거 from statsmodels.stats import anova from statsmodels.stats import multicomp 0번 코드 실행 -> 1번 코드 실행(실행 후 지우기)-> 0번 코드 실행 이렇게 하면 print(dir(stats)) 실행 시 초기에 출력이 안되던 anova, multicomp가 보이는데 왜 그런지 궁금합니다
subscribed 컬럼을 str[6:7] month로 분리 해서 계산 했는데 다른 값이 나와요 . df['month'] = df['subscribed'].str[6:7] df = df.groupby('month').count() print(df.sort_values('subscribed').index[0]) 잘 분리 되는 거 까지 봤는데 왜 계산 할 때 달라질까요 ? 날짜 데이터가 아니라 그룹바이 할 때 부터 계산이 달라 질까요 ?
r1 = sum(df.loc[2001] > df.loc[2001].mean()) r2 = sum(df.loc[2003] < df.loc[2003].mean()) 이렇게 푸셨는데. ---------------------------------------------- df = df.T # print(df.head()) # print (sum(df[2001] > df[2001].mean())) # print (sum(df[2003] < df[2003].mean())) print(sum(df[2001] > df[2001].mean()) + sum(df[2003] < df[2003].mean())) 요렇게 풀어도 되죠 ? 그리고 다 공부 했었는데 다시 보니 헷갈려서 그런데 loc 나 iloc 는 행단위로 계산이 되나요 ? 그럼 역으로 열단위로 iloc, loc는 계산 해야 할 때 (axis=1) 로 해줘야 하는 걸까요 ?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 사람들의 실기 후기를 보면 과대적합을 많이 걱정하고 또 과대적합으로 많이 떨어졌던데 검증 수치들을 0.8 ~ 0..9정도로 맞추면 과대적합을 피할 수 있나요? 아니라면 피하는 방법 알려주세요ㅠ
시험보기전 작업형 2유형을 잘 풀고있는지 의문이 들어 이렇게 문의드립니다..! 틀린부분이 없는지 한번 확인해주시면 감사하겠습니다! train과 test의 범주형컬럼의 고윳값 개수가 다를 때는 concat을 한 다음 라벨, 원핫인코딩을 해야한다는 최근 강의를 들었습니다. 그래서 아래와 같이 코드를 진행하였습니다.(2개의 범주형 컬럼의 고윳값이 10개 이상이어서 원핫은 하지 않았습니다.) train과 test의 범주형 컬럼의 고윳값 개수가 같을때도 concat을 사용하여 진행한 뒤 다시 train과 test로 데이터를 나누어 진행해도 괜찮은지 궁금합니다! 최종적으로는 어떠한 문제가 나와도 concat을 사용하여 label과 one_hot을 진행해도 되는지 궁금합니다! 늦은시간 죄송합니다ㅠ
sum을 사용할때 sum(값) 혹은 .sum( ) 이런식으로 두가지로 사용되던데 두가지의 차이가 있나요? sum 에서 어떤 경우에는 합을, 어떤 경우에는 개수를 셀때 사용하던데 각각 어떤 경우에 보통 사용되는지 혹시 예시 코드를 알려주실수 있을까요? 원핫인코딩을 할 때 object 값만 넣는게 아니라 보통 전체 데이터셋을 넣어주나요? 만약에 object 값만 넣었을때랑 전체 데이터셋을 넣었을 때랑 차이가 있을까요? 관찰값과 기대값을 구분하는 법을 잘 모르겠습니다..! 관찰값과 기대값의 리스트 순서를 동일하게 맞추기 위해서 sort를 진행하는 건가요? 만약에 관찰값과 기대값의 순서가 다를 경우 결과에 크게 영향을 미칠까요? 문제를 보고 어떤부분을 봐야 적합도 검정인지 어떻게 알 수 있을까요? 문제를 보았을 때 정확히 무엇을 묻는(어떤 방식으로 풀어야하는지) 문제인지 구분하기가 힘든 것 같습니다.. 적합도 검정뿐만 아니라 회귀분석/분산분석/ 독립성 검정 문제에서 정확히 어떤 부분을 보고 회귀 분석이다! 아니면 독립성 검정이다! 를 알 수 있을까요? 개념이 정확히 정리가 안된 것 같은데 .. 문제를 보고 구분하는 방법을 알려주시면 감사하겠습니다.. ㅜㅠ groupby(~~).mean() 형태로 많이 쓰이던데 mean 말고 다른 것도 사용할 수 있는지, mean 밖에 안되는지 궁금합니다. 다른 것도 사용할 수 있으면 어떤게 있는지 알려주세요! 질문이 너무 많네요..!! 답변 부탁드립니다
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 아래 코드에서y_test 는 0,1,0 등의 값이고 pred 는 proba 확률값인데 저렇게 평가점수를 내는것도 가능한가요? y_test = pd.read_csv("y_test.csv") y_test roc_auc_score(y_test, pred)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 age 칼럼의경우 20대 30대 40대 이렇게 나누는 이유가 있을까요? 또 그렇게 범주형으로 나누려면 어떻게 코드를 작성해야할지 궁금합니다!!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요, 선생님 강의와 동일하게 전처리 및 인코딩 후 결과값을 출력했는데 강의와 제 답의 pred[:,1] 값이 차이가 나는데 , roc_auc_score 값은 0.72 정도로 잘 나옵니다. 말씀하신것처럼 평가는 제출된 csv로 한다고 했을떄 확률값이 다른건 자연스러운 현상일까요?