inflearn logo
강의

講義

知識共有

[非専攻者大歓迎]ゼロベースも簡単に入門するPythonデータ分析

Chapter 1-1.住宅価格予測の問題

결측치 채우기 부분 관련 질문

394

owenchoi96

投稿した質問数 45

0

안녕하세요 선생님. 결측치 채우기 섹션에서 궁금한 부분이 있어 질문을 드립니다.

결측치 채우기 부분에서 왜 문자열 데이터는 빈도가 높은 데이터 순을 대치하는 방법을 적용하는지 궁금하여 여쭤봅니다.

그리고 그 아래 코드에 .mode()는 어떤 것을 의미하는 지 알려주시면 감사드립니다.

그 부분과 연결지어 아래 부분에,

# 이제 각 Feature 마다 빈도수가 가장 많이 나타나는 값을 추가하는 코드를 작성한다.

for i in final_cat_vars:

all_df[i] = all_df[i].fillna(all_df[i].mode()[0])

빈도수가 가장 많이 나타나는 값을 왜 추가하는지 알려주시면 감사드립니다.

 

 

matplotlib scikit-learn 머신러닝 배워볼래요? kaggle python numpy pandas

回答 1

0

Evan

  1. 결측치 대치는 여러가지 방법이 있는데, 그 중 가장 쉬운 방법인, 빈도수가 가장 많이 나온 것을 대체 한 것입니다. 이 방법이 꼭 좋은 방법은 아니나, base 머신러닝 모형을 구축할 때는 쉽게 구축 할 수 있기 때문에 사용한다고 생각하면 될 것 같습니다.

  2. mode() 함수는 문자열의 각 값을 계산한 후, 높은 순부터 정렬하여 반환합니다. mode()[0]은 각 칼럼에서 가장 높은 값을 추출한다는 뜻입니다.

 

결측치 대치는 이 문제 하나만으로도 논문으로 나올 수 있는 매우 어려운 문제입니다. 본 강의에서는 가장 쉬운 방법을 택했다고 보면 될 것 같습니다. 문자열 결측치에서 가장 큰 어려운 문제는 high-cardinality 이슈가 있습니다. 관련 키워드로 검색해보시고, 혹시나 이해가 어려우면 추가로 강의를 제작해서 올리도록 하겠습니다.

Cursor 실행 문의

0

9

1

데이터 전처리 관련

0

9

2

시험에서 문제 불러오기

0

7

2

2번문제 출력값 질문

0

12

2

pd.get_dummies()가 bool로 반환

0

13

2

대응표본검정 레빈

0

17

3

단일표본검정 문제 유형

0

17

2

[작업형 3] 6~7. 카이제곱 검정

0

15

2

시스템 아키텍처를 강의에 나온 것 처럼 그리고 싶은데 공유 가능할까요?

1

11

2

9회 작업형3 문제 1-1

0

26

2

최종답안 계산 방식 질문

0

17

1

PROJECT_STRUCTURE.md 파일 공유좀 해주세요

0

16

2

맥북에서 아이패드로 연결해서 보려고 하면 화면이 안뜹니다.

0

5

1

시험 치기 전 급하게 질문 사항

0

29

2

노션 사용권한 불편합니다.

0

13

2

유형3

0

28

2

작업형 2 연습문제 섹션 3

0

18

2

boxcox를 변환하는 코드 에

0

811

2

레몬에이드 데이터 자료에 없습니다

0

427

1

데이터셋 압축 문제

1

392

1

주피터 노트북, 비쥬얼 스튜디오 다안되는데 다른 방법이없나요

0

198

1

강의자료

0

320

1

레몬에이드 데이터 자료에 없습니다

0

410

2

선생님 문의드립니다.

1

421

2