결측값 처리
603
작성한 질문수 2
답변 1
0
결측치의 %가 크다고 항상 컬럼을 삭제하지는 않습니다.
가능한 타당한 값으로 대체하는 것이 필요한데, 일단 평균치로 대체한 후에 머신러닝 모델의 성능이 개선되는지를 직접 확인해보는 방법이 있겠습니다. 항상 가장 중요한 것은 모델의 성능이 개선되는지를 보고 선택 여부를 판단하는 것입니다. 문제에 따라서 결과가 다르기 때문입니다.
또한 일괄적으로 평균치를 취하는 방법 외에도 개선된 방법들이 있습니다. 예를 들어 다른 변수를 보고 좀더 근접한 값으로 추정할 수 있겠지요. 예를 들어 키라면 나이를 보고 연령대별 평균을 사용한다든지 하는 방법입니다.
결측치가 카데고리 변수라면 원핫 인코딩을 한 후에 결측치는 모두 0으로 인코딩하는 방법도 있습니다. 이는 특히 모델로 랜덤포레스트 모델을 사용할 때 유용합니다. 결측치가 있는 샘플은 트리 분류에서 다루지 않는 방법입니다.
답이 되었는지요?
[클라우드 설정 중 앞 내용 문의 사항]
0
11
0
nvm버전이 변경되었습니다.
0
15
0
선생님 강의자료를 받을수 없어요! 메일보냈어요.
0
19
2
response api를 사용하는것과 codex, cluade code 에이전트를 사용하는것과의 차이
0
16
1
16강 구글 colab 에서 코드 실행이 안돼요.
0
31
1
object 컬럼이 여러 개인 경우 인코딩 전처리 방법
0
17
2
데이터 전처리 순서 관련
0
16
2
작업형2 모의문제 데이터 불러오기
0
23
2
강의 연장 부탁드립니다!
0
19
1
베개머리투자법 섹션 5를 듣고 질문드립니다.
0
22
2
[질문] 파이썬 버전 질문
0
23
1
강의자료, 코드 요청드립니다
0
36
1
모의고사 파일오류
0
60
3
미국 써머 타임 적용에 대해서 질문입니다.
0
28
1
테마분류 세부화 관련 질의
0
35
2
비만도까지 구하는 프로그램을 만들었습디나
0
38
1
n_step 값에 대하여
0
480
1
dir*.csv가 안됩니다.
0
367
1
6 시그마 이상 outlier
0
589
1
로그변환에 대하여
0
674
1
In[42] 14:50 코드 질문
0
279
1
Titanic 데이터셋 PClass cateogrical -> one hot encoding
0
423
1
표준 스케일링관련 문의
0
349
1
6:14초 dataframe 스케일링한 후 컬럼 추가에 대한 질문
0
771
1





