작업형2를 풀때, 라벨인코더를 해서 풀고 마지막에 오류로, Train에서는 라벨인코더가 되었는데.. Test데이터에서는 라벨인코더가 되지 않음을 확인하였습니다. gpt는 이 이유가, train간 test데이터 사이에 항목이 달랐기 떄문에 이런 오류가 났다고 설명하는데...(예를 들어 train에 라벨인코더한 항목이 A.B.C로 되어있다면 test데이터는 A,B,C,D로 되어있어 나는 오류) 그럼 라벨인코더를 쓸때는 꼭, train, test간 데이터 종류/갯수가 같은것을 확인하고 쓸 수 밖에 없는건가요..?? 이런경우 그냥 더미변수처리를 해야하는걸까요?ㅠㅠ
여기서 concat을 사용하는 이유가 X_train과 y_train을 df로 합치기 위해서인데, labelencoding은 왜 X_train으로 진행하신건가요? X_train.select_dtypes(include = 'object') 가 아닌 df.select_dtypes(include = 'object') 가 아닌짛 해서요.
다중회귀모델을 학습할 때 독립변수에 포함된 범주형변수를 인코딩 안 하고 학습했을 때의 결정계수값과 인코딩 했을 때의 결정계수 값이 다르게 나오는데, 이런 경우 인코딩을 하고 계산하는 게 맞는건가요? 전자는 자동으로 처리가 된 것 같은데 시험에서는 어떤걸 정답으로 쳐주는지 궁금합니다!
시나공 빅분기 교재관련 문의 p.177 25번 문제에서 시간간격이 1일 이하인 사용자를 제외하고 계산하라고 했는데 cond1 = time_interval > 0 로 되어 있는데 cond1 = time_interval > 1 이 되어야 하는게 맞지 않을까요?? 혹시 " > 0 " 으로 풀이한 이유가 있을까요?? ps. 교재관련 정오표를 찾고 있는데 어디서 찾을 수 있을까요??
문제8, 문제9 풀이에서 numeric_only=True 옵션에 대해서 궁금해서 질문해요 문제 8번 풀이에서df =df.groupby(['city','f2']).sum(numeric_only=True).reset_index() df =df.groupby(['city','f2']).sum(numeric_only=True).reset_index() 에서는 컬럼 'city' 와 'f2' 컬럼이 수치형 자료라 numeric_only=True 를 설정해야 하는 건가요!? 문제 9번 풀이에서 groupby 로 월 별 데이터 개수를 구할 때는 count(numeric_only=True) 로 설정하면 오류나는 이유는 뭔가용..??? month 가 숫자형이어서 그런가요 아니면 count 가 설정할 필요가 없어서인가요 ? ㅠ.ㅠ numeric_only=True 를 어느 때 써야하고 안 써야하는지 구분하는게 정확히 어떤 기준인지 궁금합니다
#train['환불금액']=train['환불금액'].drop #test['환불금액']=test['환불금액'].drop train=pd.get_dummies(train) test=pd.get_dummies(test) target=train.pop('성별') from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train,target,test_size=0.2,random_state=0) from sklearn.ensemble import RandomForestClassifier model=RandomForestClassifier(random_state=0) model.fit (X_tr,y_tr) pred=model.predict(test) submit=pd.DataFrame({'pred':pred}) submit.to _csv('result.csv',index=False) a= pd.read _csv('result.csv') print(a.head()) 위와 같이 한가지방법으로 풀기와 동일하게 진행하였는데 model.fit (X_tr,y_tr) 에서 오류가 납니다. 결측치가 있는 '환불금액'열을 삭제해도 동일한데 한가지방법으로 푸는 코드에 오류나 잘못된 부분이 있을가요?.
한글 자동화 관련해서 공부할 강의 분량이 너무 많아서 완강은 아직 엄두도 안나고, 그냥 쭉 한 번씩 구경(?)하던 중이었는데요. 13-2. 녹화된 스크립트매크로를 파이썬에서 활용하는 방법 이 강의에서는 내용이 전혀 뜨지 않네요. (아래 캡처) 제 컴퓨터 환경에 문제가 있는 것일까요?
안녕하세요, 강의와 교재로 공부하고 있습니다. 교재 작업형2 ch4 회귀 부분에서 트레인 테스트 데이터를 합친 후 범주형 데이터를 레이블 인코딩 한 후 다시 트레인 테스트로 쪼개고 결측치를 채우는 최솟값, 최빈값으로 채우는 과정으로 진행이 되는데요, 레이블 인코딩 과정에서 범주형데이터의 결측치가 하나의 값으로 인코딩이 되어서 결측치가 존재하지 않아 중앙값으로 결측치를 대체하는 과정이 불필요한 것 같은데 맞을까요? 또한 원핫 인코딩을 사용하려는 경우 결측치를 먼저 대체한 후에 인코딩을 해야 오류가 안나는게 맞을까요? 일반적으로 결측치 처리를 인코딩 후에 하는지 전에 하는지 궁금합니다. 감사합니다.
작업형2 모델 분석 및 결과 제출에 대해 질문이 있습니다. 회귀분석을 예로들면 랜덤포레스트회귀, XGB회귀, 릿지, 라쏘 등 다양한 모델을 사용해서 모델 마다 도출하는 값이 다른고 그 중 가장 높은 값(r2값이나 mse 값 등 문제에서 평가로 제시된 지표)을 사용한다고 알고 있습니다. val데이터로 학습을하고 가장 높은 값을 찾아서 마지막에 pred = model.predict(test)로 대입하는데, 모델을 선택하는 과정이 없는 것 같습니다. 이렇게 두개의 모델을 사용해서 각각 값을 도출해서 위와 같은 값이 나왔고 이런식으로 test데이터를 예측값에 적용하는데 위 두개에 모델중에 더 나은 모델을 선택하는 과정이 없는건가요?? 두개의 모델이 다 활성화 되어있는데 저렇게 밑에 model.predict만 적어놓으면 이 모델이 xgb인지 랜덤포레스트인지 어떻게 인식하는걸까요?
모의고사 문제 3번 풀이 관해서 질문 드려요! 문제 3번 풀이가 방법이 총 세가지로 풀이 해주셨는데 ( replace, map, 조건) 혹시 시험에서 저런 류의 문제에서 결측치랑 데이터값을 변경하라는 문제에서 어떤 특정한 풀이를 이용해서 풀라고도 나오기도 하나요? 아니면 저 세개중에 한가지 방법만 사용해서 답만 구해도 상관 없는건가요!?