Text Analysis 실습(Mercari Price Suggestion) 질문
안녕하세요. 좋은 강의 감사합니다.
실전 텍스트 분석: 04 - Mercari Price Suggestion 피처 인코딩과 피처 벡터화 수행 ( 3분 ~ 4분)
수업 진행 중에 질문이 있습니다.
feature vectorization을 item description에 적용하는 건 이해가 되는데, name에 적용하는 이유가 있을까요?
name 자체가 거의 유니크 하기 때문에 feature 로써
의미가 없지 않을까 해서 질문드려요!
(item description 같은 경우는 각 단어 별로 중복도 많이 생기고 패턴이 생겨서 예측에 도움이 될 거라 생각했고, name 같은경우는 거의 유니크해서 feature 자체에서 제외해야 하지 않을 까 하는데, 잘못 이해 하고 있을까요?)
또한, 예제는 회귀 모델을 보여주셨는데, 분류 모델에서도
좋은 성능을 낼까요?
비정형 데이터(텍스트 문서)와 정형 데이터를 합쳐서 예측 하는 경우 분류 모델 로도 많이 사용되는지 궁금합니다!
감사합니다.
답변 1
0
안녕하십니까,
name을 feature에 포함시킨 이유는 name 자체 속성이 target값에 영향을 미칠 수 있기 때문입니다. 즉 제품명(어떤 제품인지에 따라)에 따라서 target값의 상관도가 존재합니다.
물론 titanic 모델과 같이 이름이 unique하고, target값과 상관이 없는 경우라면 이는 제거하는 게 오히려 오버피팅을 개선하는 측면에서 더 좋을 수 있지만, 여기서는 상황이 좀 다릅니다.
비정형 데이터(텍스트 문서)와 정형 데이터를 합쳐서 예측 하는 것이 특별히 회귀에만 적용하는 것은 아닙니다. 모델이 목표로 하는 바에 따라서 분류에도 적용가능합니다.
감사합니다.
모델 서빙과 관련된 강좌가 출시되는지 질문드립니다.
0
24
2
안녕하세요 열심히 수강중인 학생입니다
0
68
2
정수 인덱싱
0
71
2
넘파이 오류
0
88
2
11강 numpy의 axis 축 질문 드립니다.
0
89
2
Kaggle 에서 Santander customer satisfaction data 를 다운로드 되지가 않습니다.
0
80
2
Feature importances 를 보여주는 barplot 이 그래프로 안보여져요.
0
71
2
타이타닉 csv 파일이 주피터 화면에 보이지 않습니다.
0
76
2
타이타닉 csv 파일이 주피터 화면에 보이지 않습니다.
0
65
2
5강 강의 오류가 있어요.
0
86
1
실무에서 LTV 관련 모델 선택 질문입니다!
0
74
2
14강 강의 듣는중에 궁금한게 있어서 질문합니다~
0
70
3
파이썬 다운그레이 후 사이킷런 재설치
0
122
2
좋은 강의 감사합니다.
0
75
2
scoring 함수 음수값
0
68
2
6번 강의에 사이킷런, 파이썬, 아나콘다 각각 버전 일치 안 시키고 진행해도 강의 따라가 지나요?
0
104
2
분류 평가 정확도 예측
0
80
2
안녕하세요. 강의 들으면서 업무에 적용하고 싶은 수강생입니다.
0
100
1
카카오톡 채널 있나요
0
110
1
혹시 강의에서 사용하시는 ppt 받을 수 있는건가요
0
191
2
pca 스케일링 관련하여 질문드립니다.
0
102
2
주피터 대신 구글 코랩
0
174
2
강의에서 사용하는 pdf or ppt자료는 따로 없는 건가요?
0
149
2
실루엣 스코어..
0
87
2





