inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

작업형2 정리한 내용 확인 부탁드립니다 ㅜㅜ

51

김휘

작성한 질문수 1

0

###데이터전처리

(범주형 데이터 수 많은데 카테고리 다를 때 삭제, 비행기 문제 생각)

train = train.drop(‘컬럼명’, axis=1)

test = test.drop(‘컬럼명’, axis=1)

결측치 채우기 (범주형)

cond_o = ['범주형컬럼명1',‘컬럼명2’...]

train[cond_o]=train[cond_o].fillna("X")

test[cond_o]=test[cond_o].fillna("X")

결측치 채우기 (수치형, 0/중앙값/최소값/평균 등 데이터에 맞게)

cond_f = ['컬럼명1‘,’컬럼명2'...]

train[cond_f]=train[cond_f].fillna(0)

test[cond_f]=test[cond_f].fillna(0)

target = train.pop(‘타겟컬럼명’)

 

###인코딩

print(train.shape, test.shape)

train = pd.get_dummies(train)

test = pd.get_dummies(test)

print(train.shape, test.shape)

 

(범주형 카테고리 다르면 합쳐서 원핫인코딩 진행)

print(train.shape, test.shape)

concat = pd.concat([train,test])

concat_dummies = pd.get_dummies(concat)

n_train = len(train)

train = concat_dummies[:n_train]

test = concat_dummies[n_train:]

print(train.shape, test.shape)


###하이퍼파라미터

class_weight='balanced' : 타겟 데이터 불균형일 때 사용

max_depth : 3~7(분류) 7~12(회귀)

n_estimators : 200~600 (100단위)

learning_rate : n_estimators 와 반비례하게 사용 - 0.01~0.1 (랜덤포레스트에서 적용 안됨)



이렇게 정리해서 외워도 될까요??

하이퍼파라미터는 각각 어떤 상황에 사용해야 하는지 잘 모르겠습니다ㅠㅠ


python 머신러닝 빅데이터 pandas

답변 1

0

퇴근후딴짓

좋습니다 :) 다만

max_depth : 3~7(분류) 7~12(회귀)

n_estimators : 200~600 (100단위)


이것 튜닝 보다는 그대로 두시고

러이트지비엠과 랜덤포레스트 모델을 2개 비교해 보시죠!!

0

김휘

넵 감사합니다!!!

2회 기출유형(작업형1) Warning

0

28

2

describe()

0

40

2

수강기간 연장 문의

0

67

2

빅데이터분석기사 실기 인코딩

0

61

2

수강기간 연장문의

0

63

2

수강 기간 연장 문의 드립니다.. 부탁드립니다 ㅠㅠ

0

51

2

작업형2와 3의 목적

0

40

1

기출9회(작업형 1의 2번문제)

0

40

2

수강 기간 연장 문의 드립니다.

0

57

2

수강 연장 문의드립니다

0

66

2

수강 연장 문의드립니다.

0

52

2

재결제 가능할까요...

0

60

1

비전공자 빅분기 실기 공부방법

1

69

2

강의일시정지 요청합니다

0

63

2

강의 연장 가능할까요 ㅠㅠ

0

58

2

수강 연장 문의드립니다.

0

64

2

수강기간 연장 가능 여부 문의드립니다.

0

83

1

수강 기간 연장 가능 여부 문의드립니다

0

85

2

강의 업데이트

0

81

2

수강 연장 문의드립니다.

0

102

2

강의 연장 문의

0

76

2

수강 신청 연장 문의드립니다.

0

89

2

작업형 1번문제... 환경관련

0

68

2

12회 기출은 언제 업데이트 될까요??

1

89

2