4회 기출 작업형2
왜 어떨때는 이렇게 쓰고
rf.fit(x_tr, y_tr)
pred_val = rf.predict(x_val)rf.fit(train, target)
pred = rf.predict(test)풀이영상에서는 바로 트레인, 타겟이라고 적는지 궁금합니다!
추가로, 아래 코드에서 수치형 변수->스케일링, 범주형 변수 -> 인코딩을 진행하고 싶은데
주석처리한 코드 부분을 어떻게 수정하면 될까요??
# your code
# 라이브러리 불러오기
import pandas as pd
train = pd.read_csv("train.csv")
test = pd.read_csv("test.csv")
# EDA
train.shape, test.shape # ((6665, 11), (2154, 10))
train.isnull().sum()
test.isnull().sum()
# train.info()
# test.info()
# 전처리(타겟, 결측치, 인코딩, 스케일링)
train = train.drop("ID", axis = 1)
test_ID = test.pop("ID")
target = train.pop("Segmentation")
# train.head()
# test.head()
# c_train = train[["Gender", "Ever_Married", "Graduated", "Profession", "Spending_Score", "Var_1"]]
# c_test = test[["Gender", "Ever_Married", "Graduated", "Profession", "Spending_Score", "Var_1"]]
# c_train = pd.get_dummies(c_train)
# c_test = pd.get_dummies(c_test)
train = pd.get_dummies(train)
test = pd.get_dummies(test)
# n_train = train[["Age", "Work_Experience", "Family_Size"]]
# n_test = test[["Age", "Work_Experience", "Family_Size"]]
# from sklearn.preprocessing import StandardScaler
# scaler = StandardScaler()
# n_train = scaler.fit_transform(n_train)
# n_test = scaler.fit(n_test)
# train = pd.concat([c_train, n_train])
# test = pd.concat([c_test, n_test])
# train.info()
# test.info()
# 모델링(학습)
from sklearn.model_selection import train_test_split
x_tr, x_val, y_tr, y_val = train_test_split(train, target, test_size = 0.2, random_state = 40)
from sklearn.ensemble import RandomForestClassifier
rf = RandomForestClassifier()
rf.fit(x_tr, y_tr)
pred_val = rf.predict(x_val)
# 평가 Macro f1-score
from sklearn.metrics import f1_score
f1 = f1_score(y_val, pred_val, average = "macro")
pred_test = rf.predict(test)
# 제출(데이터프레임, pdf, index = False)
result = pd.DataFrame({
"ID" : test_ID ,
"Segmentation" : pred_test
})
result.to_csv("수험번호.csv", index = False)
답변 1
0
검증데이터로 평가지표 점수를 체크하지 않고 바로 test예측 후 제출이 가능하다는 부분을 보여주고자 했어요~!
아직 원하는 형태로 작업하기 보다 필사(똑같이)로 준비하는 것이 어떨까요?
기출3만 수치형과 범주형을 나누었고, 나머지는 함께 처리 했어요! 기출 5,6,7에서 진행하는 형태로 쪼개지 않고 처리하는 방법을 연습해주세요 🙂더불어 최대한 답변으로 질문에 도움을 드리려고 하나 이런 형태의 질문은
저도 하나하나 실행하면서 체크를 해야하는 부분이라 답변드리기는 어려움이 있습니다 🥲눈에 보이는건
pd.concat([c_train, n_train])에서 axis=1로 설정이 필요해요
강의 연장 문의
0
8
1
수강 신청 연장 문의드립니다.
0
19
1
작업형 1번문제... 환경관련
0
24
2
12회 기출은 언제 업데이트 될까요??
0
35
2
8/6 작성한 연장문의 질문글에 대한 재요청
0
37
2
수강기간 연장 문의
0
34
2
수강기간 연장문의
0
36
2
수강기간 연장 요청 문의드립니다
0
36
2
수강 기간 연장 문의
0
44
2
수강연장 가능 문의 (기간 약 한달반)
0
57
2
수강기간 연장 가능할까요 선생님
0
72
2
Section15. 수업에 사용하는 데이터 주소가 다 보이지 않아서 실습을 위한 데이터를 다운 받지 못하고 있습니다.
0
52
3
수강연장요청 문의
0
85
2
아무래도 다음 시험 연장은 어렵겠죠?
0
105
2
빅분기 12회 결과 관련 문의
0
111
1
책이랑 강의랑 순서나 예제가 다른것 같네요
0
80
2
수강연장 문의
0
103
2
재검토 요청 방법 좀 알려주셔요...-.-;;
0
103
2
12회 실기 질문(작업형 2)
0
90
2
뒤로가기 버튼 같은 것이 있나요?
0
64
1
강의 연장 문의
0
98
2
출력값 질문
0
70
2
수업노트가 어디에 있나요?
0
63
1
실기시험 제출관련
0
225
3





