캐글 T2-5. Insurance Forecast (Regression) 질문
y= y_train['charges']
# X_train.info() object : sex, smoker,region
# X_train.isnull().sum() --> 결측값 없음
X_train.head(2)
drop_col = ['id']
train_drop = X_train.drop(columns=drop_col)
test_drop = X_test.drop(columns=drop_col)
#원핫인코딩
X_train_dummies = pd.get_dummies(train_drop)
X_test_dummies = pd.get_dummies(test_drop)
#train_test_split
from sklearn.model_selection import train_test_split
x_tr,x_val,y_tr,y_val = train_test_split(X_train_dummies,y,test_size=0.33, random_state = 42)
#랜포
from sklearn.ensemble import RandomForestRegressor
model = RandomForestRegressor()
model.fit(x_tr,y_tr)
pred = model.predict(x_val)
#평가
from sklearn.metrics import mean_squared_error,r2_score,mean_absolute_error
import numpy as np
print("rmse", np.sqrt(mean_squared_error(y_val,pred)))
print("r2_score",r2_score(y_val,pred))
print("mae", mean_absolute_error(y_val,pred))
#저장
answer = model.predict(X_test_dummies)
result = pd.DataFrame({'id': X_test.id, 'charges' : answer})
result.to_csv('00000.csv', index = False)
output = pd.read_csv("00000.csv")
print(output.head(2))
선생님 안녕하세요. 지금 코드 틀 외워서 하나하나 문제 풀어보고 있습니다.. 작년에 회귀문제에서 된통 당한 이후로 꼼꼼히 보고 있는데 아직 확신이 서지 않습니다 ㅠㅠ 혹시 여기서 코드 오류가 있을까요..?
더불어 T2-5의 경우 결측치도 없고, object도 별로 없어서 get_dummies로 해결했는데
T2-4처럼 결측치도 많은데다가 object도 많이 있으면 어떻게 해야할지도 잘 모르겠습니다..
답변 1
0
크게 문제는 없어 보입니다.
test_size=0.33 은 데이터 수가 작을 수 있어 0.2로 추천해요!
결측치가 아직 문제에서 출제된적은 없어요! 시험환경 특성상 많은 컬럼이 있는 데이터를 사용하지는 않을거에요~ 보기가 어려워요!
질문 드립니다.
0
37
2
강의 내용 관련 질문드립니다~
0
34
2
수강 연장 문의
0
31
1
강의자료 일괄 다운로드
0
41
2
수강기간 연장 문의드립니다
0
28
1
list 문제 질문드립니다~
0
28
2
빅분기 실기 12회 재도전
0
39
1
강의 기간 연장 가능여부 검토 요청건
0
30
1
수강기간 연장 문의 드립니다
0
36
2
수강기간 연장 문의드립니다
0
47
2
질문이요
0
51
2
수강기간 연장 문의드립니다.
0
49
2
문제 3-2 질문드립니다
0
43
2
수강기간 연장 문의 드립니다.
0
58
2
변수, 칼럼 , df 구분
0
48
2
수강기간 연장 문의드립니다.
0
49
2
수강기간 연장 문의
0
46
2
수강기간 연장 문의드립니다.
0
40
2
수강기한 연장 문의
0
76
2
수강기간 연장 문의드립니다
0
57
2
결정트리에서 적절한 깊이 선택 후 시각화 과정에서 학습 데이터만 사용하는 이유
0
44
2
수강기간 연장 문의드립니다.
0
70
2
수강연장 문의
0
76
2
수강연장문의
0
53
2





