인코딩 관련 질문 있습니다
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요!
질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요
먼저 유사한 질문이 있었는지 검색해보세요
범주형 컬럼(a,b,c,d,e)의 nunique값에서 (a,c) 컬럼은 50으로 좀 크고
나머지 컬럼은 5정도로 작을 경우에 labeling과 one hot encoding을 각각 적용하고 싶다면
cols = [a,c]으로 두고 반복문을 통해 le를 한다음
get_dummies를 하면 될까요?
답변 2
1
현업에서는 조금이라도 모델 성능을 높이고자 컬럼별로 다르게 적용합니다.
하지만 시험에서는 이렇게까지 할 필요는 없을 것 같습니다.
차라리 한가지로 통일해 적용후, 모델 3개 정도 비교하시죠!!
0
안녕하세요, 인프런 AI 인턴입니다. 남미미미님.
범주형 데이터의 인코딩 전략에 관해 문의주셨습니다. 레이블 인코딩과 원핫 인코딩을 컬럼별로 어떻게 적용할지 고민하고 계시는데요. 각 컬럼의 고유 값(nunique)에 따라 인코딩 방식을 선택하고자 하시는 것 같습니다.
- 라벨 인코딩(Label Encoding): 고유 값의 개수(nunique)가 상대적으로 많은 컬럼에 적합합니다. 예를 들어
cols = ['a', 'c']로 설정하고,LabelEncoder를 사용하여 다음과 같이 인코딩할 수 있습니다:
”`python
from sklearn.preprocessing import LabelEncoder
le = LabelEncoder()
for col in cols:
train[col] = le.fit_transform(train[col])
test[col] = le.transform(test[col])
2. **원핫 인코딩(One-Hot Encoding)**: 유니크 값의 개수가 적은 컬럼에 적합합니다. 나머지 컬럼 `['b', 'd', 'e']`는 `pd.get_dummies()` 함수를 사용하여 인코딩합니다:
```python
train = pd.get_dummies(train, columns=['b', 'd', 'e'])
test = pd.get_dummies(test, columns=['b', 'd', 'e'])
이러한 방법으로 컬럼별로 적절한 인코딩을 적용하실 수 있습니다.
이 링크를 참고하시면 유사 질문들의 다양한 사례를 이해하는 데 도움이 될 수 있습니다. 질문자의 경우는 원핫인코딩이 어떻게 범주형 데이터를 자동으로 선택해 인코딩하는지에 대한 답변을 포함하고 있습니다.
저는 질문자님의 이해를 돕고자 지식공유자님의 기존 답변을 참고하여 유사한 답변 링크를 추천해드리고 있습니다.
현재 베타 기능으로 답변이 만족스럽지 않을 수 있는 점 양해 부탁드립니다. 🙏
추가적으로 궁금한 점이 있으시면, 이어서 질문해 주세요. 곧 지식공유자께서 답변해 주실 것입니다.
수강 연장 문의드립니다.
0
20
2
강의 연장 문의
0
29
2
수강 신청 연장 문의드립니다.
0
40
2
작업형 1번문제... 환경관련
0
30
2
12회 기출은 언제 업데이트 될까요??
0
38
2
8/6 작성한 연장문의 질문글에 대한 재요청
0
38
2
수강기간 연장 문의
0
40
2
수강기간 연장문의
0
37
2
수강기간 연장 요청 문의드립니다
0
38
2
수강 기간 연장 문의
0
47
2
수강연장 가능 문의 (기간 약 한달반)
0
60
2
수강기간 연장 가능할까요 선생님
0
74
2
Section15. 수업에 사용하는 데이터 주소가 다 보이지 않아서 실습을 위한 데이터를 다운 받지 못하고 있습니다.
0
56
3
수강연장요청 문의
0
90
2
아무래도 다음 시험 연장은 어렵겠죠?
0
109
2
빅분기 12회 결과 관련 문의
0
112
1
책이랑 강의랑 순서나 예제가 다른것 같네요
0
81
2
수강연장 문의
0
106
2
재검토 요청 방법 좀 알려주셔요...-.-;;
0
106
2
12회 실기 질문(작업형 2)
0
92
2
뒤로가기 버튼 같은 것이 있나요?
0
66
1
강의 연장 문의
0
99
2
출력값 질문
0
73
2
수업노트가 어디에 있나요?
0
63
1





