inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

4회 기출 유형(작업형2)

4회 기출 유형(작업형2) 질문

해결된 질문

587

김태범

작성한 질문수 15

1

안녕하세요 강사님 아래와 같이 코드를 짜보고 강의를 들었는데

  1. 저는 train_test_split을 썼으므로 강의에서와 같이

target = train.pop('Segmentation') 과정이 필요없는게 맞나요?

  1. 아래는 제가 짠 코드이고 leaderboard 점수 0.30927입니다. 이정도 점수면 충분할까요?

  2. 제가 아래 코드에

from sklearn.metrics import roc_auc_score 
print(roc_auc_score(y_val, pred) 

를 추가할시 아래와 같은 에러코드가 납니다. 자체적으로 평가점수를 보고싶어서 추가해보았는데 왜 이런문제가 생기는걸까요?

---------------------------------------------------------------------------
ValueError                                Traceback (most recent call last)
/tmp/ipykernel_27/2182156644.py in <module>
     28 
     29 from sklearn.metrics import roc_auc_score
---> 30 print(roc_auc_score(y_val, pred))
     31 
     32 

/opt/conda/lib/python3.7/site-packages/sklearn/metrics/_ranking.py in roc_auc_score(y_true, y_score, average, sample_weight, max_fpr, multi_class, labels)
    558             )
    559         if multi_class == "raise":
--> 560             raise ValueError("multi_class must be in ('ovo', 'ovr')")
    561         return _multiclass_roc_auc_score(
    562             y_true, y_score, labels, multi_class, average, sample_weight

ValueError: multi_class must be in ('ovo', 'ovr')
import pandas as pd
train = pd.read_csv("../input/big-data-analytics-certification-kr-2022/train.csv")
test = pd.read_csv("../input/big-data-analytics-certification-kr-2022/test.csv")

cols = ['Gender', 'Ever_Married', 'Graduated', 'Profession', 'Spending_Score', 'Var_1']
from sklearn.preprocessing import LabelEncoder
for col in cols:
    le = LabelEncoder()
    train[col] = le.fit_transform(train[col])
    test[col] = le.transform(test[col])

train = train.drop('ID', axis =1)
test_id = test.pop('ID')

from sklearn.model_selection import train_test_split

X_tr, X_val, y_tr, y_val = train_test_split(
                                           train.drop(['Segmentation'],axis =1),
                                           train['Segmentation'],
                                           test_size = 0.2,
                                           random_state = 2023)

from sklearn.ensemble import RandomForestClassifier
model = RandomForestClassifier()
model.fit(X_tr, y_tr)
pred = model.predict(X_val)


pred = model.predict(test)
 
submit = pd.DataFrame({
                        'ID': test_id,
                        'Segmentation' : pred })
submit.to_csv("submission.csv", index = False)

python 머신러닝 빅데이터 pandas 빅데이터분석기사

답변 1

1

퇴근후딴짓

  1. train_test_split 괄호 안에 작성한 것을 말한다면 타겟값을 지정하였으므로 문제가 없어보입니다.💪

  2. 점수 가이드라인은 공개된 적이 없어 적정선을 언급하긴 어려울 것 같아요. 🙏

  3. roc-auc를 다중 클래스에서 사용한다면 파라미터를 하나 추가해야 합니다. 문제에서 요구하는 방식으로 평가를 진행해주세요 :)

    roc_auc_score(y_val, pred, multi_class='ovo') #일대일
    roc_auc_score(y_val, pred, multi_class='ovr') #일대다

     

수강 연장 문의드립니다.

0

20

2

강의 연장 문의

0

27

2

수강 신청 연장 문의드립니다.

0

36

2

작업형 1번문제... 환경관련

0

30

2

12회 기출은 언제 업데이트 될까요??

0

36

2

8/6 작성한 연장문의 질문글에 대한 재요청

0

38

2

수강기간 연장 문의

0

39

2

수강기간 연장문의

0

37

2

수강기간 연장 요청 문의드립니다

0

38

2

수강 기간 연장 문의

0

47

2

수강연장 가능 문의 (기간 약 한달반)

0

60

2

수강기간 연장 가능할까요 선생님

0

74

2

Section15. 수업에 사용하는 데이터 주소가 다 보이지 않아서 실습을 위한 데이터를 다운 받지 못하고 있습니다.

0

56

3

수강연장요청 문의

0

90

2

아무래도 다음 시험 연장은 어렵겠죠?

0

108

2

빅분기 12회 결과 관련 문의

0

112

1

책이랑 강의랑 순서나 예제가 다른것 같네요

0

81

2

수강연장 문의

0

105

2

재검토 요청 방법 좀 알려주셔요...-.-;;

0

106

2

12회 실기 질문(작업형 2)

0

92

2

뒤로가기 버튼 같은 것이 있나요?

0

66

1

강의 연장 문의

0

99

2

출력값 질문

0

73

2

수업노트가 어디에 있나요?

0

63

1