inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

예시문제 작업형2(ver. 2023)

원핫 인코딩 concat

178

이진혁

작성한 질문수 6

0

 

import pandas as pd

train = pd.read_csv("data/customer_train.csv")

test = pd.read_csv("data/customer_test.csv")

# print(train.shape,test.shape) #2482

# print(train.info(),test.info())

# print(train.isnull().sum()) # 결측값 존재함

# print(test.isnull().sum()) # 결측값 존재함

# 전처리

train = train.fillna(0)

test =test.fillna(0)

# print(train.isnull().sum())

# print(test.isnull().sum())

target = train.pop('성별')

df= pd.concat([train,test])

df = pd.get_dummies(df)

train = df.iloc[:len(train)]

test = df.iloc[len(train):]

print(train.shape,test.shape)

# 모델 분리 및 검증

from sklearn.model_selection import train_test_split

X_tr,X_val,y_tr,y_val = train_test_split(train,target,test_size=0.2,random_state=22)

# print(X_tr.shape,X_val.shape,y_tr.shape,y_val.shape)

# 모델 학습

from sklearn.ensemble import RandomForestClassifier

rf = RandomForestClassifier(random_state=22)

rf.fit(X_tr,y_tr)

pred = rf.predict_proba(X_val)

# 결과

pred = rf.predict_proba(test)

submit = pd.DataFrame({'pred':pred[:,1]})

submit.to_csv('result.csv',index=False)

print(pd.read_csv('result.csv').head())

print(pd.read_csv('result.csv').shape) #2482

 

 

이 식으로 풀어도 될까요??

 

 

python 머신러닝 빅데이터 pandas 빅데이터분석기사

답변 2

0

퇴근후딴짓

네 ,시험환경에 테스트 해보니 깔끔해 보입니다 🙂

0

인프런 AI 인턴

안녕하세요, 인프런 AI 인턴입니다. 이진혁님의 질문에 답변드리겠습니다.

이진혁님께서 공유하신 코드는 데이터 전처리 및 모델 학습의 일반적인 절차를 따르고 있습니다. 하지만, 몇 가지 주의할 점이 있어 이를 안내드리겠습니다.

  1. 데이터 병합 및 원핫 인코딩: train과 test 데이터를 concat한 후 pd.get_dummies()를 사용하시어 더미 변수를 생성하시는 방식은 적절합니다. 이 방법은 데이터 세트 간의 컬럼 차이를 최소화합니다.

  2. 데이터 분리: df = pd.concat([train, test]) 이후에 pd.get_dummies()를 적용하고 train과 test를 분리하는 부분도 잘 처리하셨습니다. 다만, train과 test가 원래 컬럼 수가 다르기 때문에 둘 다 pd.get_dummies()를 한 후 target(타겟 변수를 뽑아낸 후)의 컬럼이 남는 것을 방지하기 위해 제대로 분리되었는지 확인하는 것이 중요합니다.

  3. 모델 학습 및 예측: 모델 학습 후에 rf.predict_proba(test)에서의 예측은 문제가 없을 수 있지만, 주의해야 할 점은 train 단계에서 사용된 모든 피처가 test에도 동일하게 정의되어 있어야 합니다.

  4. 결과 저장: 예측 결과를 CSV 파일로 저장하는 부분은 잘 구현하셨습니다. 다만, result.csv의 결과가 예상과 다를 경우, 데이터 전처리에 문제가 있는지 확인해보는 것이 좋습니다.

유사한 질문과 답변이 있으며, 이와 관련된 내용을 참고하시면 도움이 될 수 있을 것입니다. 다음 게시물도 참고해 보세요:
- 작업형 2 - 원핫 인코딩과 데이터 병합 관련 이슈

이 게시물에서는 데이터 전처리, 특히 원핫 인코딩 후 발생할 수 있는 문제와 해결책, 모델링 과정에서 주의할 점을 다루고 있습니다.

저는 질문자님의 이해를 돕고자 지식공유자님의 기존 답변을 참고하여 유사한 답변 링크를 추천해드리고 있습니다.
현재 베타 기능으로 답변이 만족스럽지 않을 수 있는 점 양해 부탁드립니다. 🙏
추가적으로 궁금한 점이 있으시면, 이어서 질문해 주세요. 곧 지식공유자께서 답변해 주실 것입니다.

수강연장 가능 문의 (기간 약 한달반)

0

23

2

수강기간 연장 가능할까요 선생님

0

42

2

Section15. 수업에 사용하는 데이터 주소가 다 보이지 않아서 실습을 위한 데이터를 다운 받지 못하고 있습니다.

0

30

3

수강연장요청 문의

0

71

2

아무래도 다음 시험 연장은 어렵겠죠?

0

86

2

빅분기 12회 결과 관련 문의

0

96

1

책이랑 강의랑 순서나 예제가 다른것 같네요

0

72

2

수강연장 문의

0

93

2

재검토 요청 방법 좀 알려주셔요...-.-;;

0

99

2

12회 실기 질문(작업형 2)

0

82

2

뒤로가기 버튼 같은 것이 있나요?

0

60

1

강의 연장 문의

0

90

2

출력값 질문

0

65

2

수업노트가 어디에 있나요?

0

55

1

실기시험 제출관련

0

220

3

6.20 작업형 2 과적합

0

224

3

코딩팡 장업형2 베이스 라인 인코딩 종류 질문

0

81

2

로지스틱회귀, 회귀

0

73

2

회귀 문제를 풀때 질문입니다.

0

78

1

불균형 처리 후 성능이 더 낮아졌다면,

0

95

2

실기 체험 제2유형 에러 문의

0

88

1

LIGHTGBM 으로 하면 pred값이 소수점 6자리까지 나오는게 맞나요

0

73

2

3번문제 등분산 가정

0

74

2

작업형3 target 형 변환 질문

0

61

2