범주형 데이터 세트의 불균형 문제
198
投稿した質問数 1
안녕하세요, 수업을 듣다가 fraud detection을 예시로 주셨던 범주형 데이터 속성중에 세트 자체에서 불균형이 큰 경우, 예를 들어 yes 는 1000 개고 no 가 5개 밖에 없는 극단적인 불균형이 있을 때는 모델의 정확도를 맞추기 어렵다고 설명주신 부분에 질문이 있어요.
저도 사실 제 프로젝트를 하던중에 비슷한 문제가 있었어서 SMOTE같은 방법을 써서 어떻게 해서든 불균형 문제를 완화해보려고 노력했는데 주어진 데이터 자체가 너무 불균형이 심하면 설명주셨던 것처럼 별다른 방법을 찾지 못했습니다. 만약 그럼에도 불구하고 그 데이터가 중요한 속성들과 데이터라면 어떻게 다루는 것이 좋을까요?
제가 예전에 했던 방법은 정확하게는 기억이 나지 않지만 그 그룹군을 아예 나누어 data frame을 따로 짜서 분석을 진행해보려고 했던 것 같아요. (예시: no = fraud 그룹군 df, yes = non_fraud 그룹군)
실질적으로는 보통 어떻게 접근하거나 해결하는 지 궁금합니다...!
回答 1
0
네 좋은 질문인 것 같아요. 실제로 데이터 불균형 (unbalanced data)관련해서는 job interview에서 전형적으로 물어보는 질문 중 하나입니다. 데이터의 특징에 따라 여러가지 방법을 적용해볼수있는데, 실무에서 가장 많이 사용하는 방법은 앙상블(ensemble) 기법입니다. XGBoost 를 많이 사용하는데, scale_pos_weight 같은 패러미터를 써서 weight조절이 가능합니다. 그 외에도 SMOTE 같은 방식(오버샘플링)이 있지만, 이 경우 새로운 데이터가 실제 데이터 분포를 충분히 반영하지 못할 수 있기 때문에 추가로 판단해야 되구요. 언더샘플링 방식도 있지만 말씀하신 것처럼 극단적인 불균형에는 어울리지 않아 보입니다. 이외에도 Isolation Forest, Autoencoder 방식 등이 있기도 합니다. 각각 데이터 특성에 따라 섞어서 쓰기도 하고, 모든 방식을 쓴 다음 performance를 비교해서 채택하기도 합니다. 좋은 질문입니다 소요요님!!
수강 신청 연장 문의드립니다.
0
13
1
26년2회 실기기출은 언제쯤...
0
13
2
재귀함수 종료조건
0
8
1
강의 잘 들었습니다만 부탁이 하나 있어서요..
0
9
1
롱폼 영상 강의도 있으신가요? 도움이 많이 되었습니다.
1
9
1
무서워요 다음에는... 조심.
1
14
1
git bash .env
1
11
1
예제 001 실행 안됩니다.
0
13
3
ipython 설치가 안되는거 같습니다.
0
9
1
이론 공부법 요약본 버전 업데이트 문의
0
15
2
피드백 내용 문의드립니다.
0
20
0
백준 서비스 종료로 인한 강의 자료 업데이트 요청드립니다.
0
22
1
백준 사이트 준비중이라 문제를 볼 수 가 없어요
0
21
1
작업형 1번문제... 환경관련
0
23
2
09차 네이버 영화 리뷰 수집 실습 관련 질문
0
26
1
12회 기출은 언제 업데이트 될까요??
0
32
2
알파벤티지 sleep(5) 관련 문의
1
38
2
강의 자료 및 코드 수령
0
29
2
8/6 작성한 연장문의 질문글에 대한 재요청
0
36
2
실전 계좌에서 운영하고 계신 분 계신가요?
1
40
2
수강기간 연장 문의
0
32
2
수강기간 연장문의
0
34
2
수강기간 연장 요청 문의드립니다
0
33
2
Fal.ai에 기존 AI를 끌어오는것은 안되는건가요?
0
35
2

