inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

알고리즘 트레이딩의 비밀, AI가 주가를 맞추는 법

주가 정보 수집 및 데이터 정리 및 변환 과정

[데이터 전처리] dropna에서 특정 두 지표만 기준으로 결측치를 제거한 이유가 궁금합니다

해결된 질문

30

운머

작성한 질문수 2

1

안녕하세요.
데이터 결합 후 아래 코드에서

result_df = result_df.dropna( subset=['10년 기대 인플레이션율', '장단기 금리차'], how='any' )

전체 지표가 아니라 '10년 기대 인플레이션율', '장단기 금리차' 두 컬럼만 기준으로 결측 행을 제거한 이유가 궁금합니다.

이후 ffill()로 나머지 결측값을 채우는 구조인 것으로 이해했는데,
이 두 지표의 데이터 시작 시점에 맞춰 전체 학습 구간을 설정하기 위한 것인지, 아니면 모델링상 반드시 포함되어야 하는 핵심 변수라서 별도로 처리한 것인지 궁금합니다.

감사합니다.


python 딥러닝 재테크 lstm transformer

답변 1

1

치트키맨 (치트키 알려주는 남자)

안녕하세요, @운머님.

운머님께서 생각하신 두 가지 이유가 모두 맞습니다.

  1. 학습 시작 구간 설정 (유효 분석 기간)

    지표마다 데이터 수집 시작 시점이 다릅니다. 두 핵심 지표가 모두 집계되기 시작한 시점을 전체 데이터의 실질적인 분석 시작점으로 정하기 위함입니다.

  2. 핵심 변수 왜곡 방지

    보조 지표의 일시적 공백은 ffill()로 채워도 무방하지만, 모델링의 핵심인 두 지표 자체가 없는 과거 구간은 단순 대체보다 제외하는 것이 데이터 신뢰성 측면에서 안전하기 때문입니다.

즉, "두 핵심 지표가 모두 존재하는 시점부터 분석을 시작하고, 나머지 미세 결측은 ffill()로 채운다"고 이해하시면 됩니다.

추가로 궁금한 점이 있으시면 언제든 편하게 질문 주세요. 감사합니다!

11차시 Antigravity IDE 설치 후

0

12

1

링크드 리스트 중간 삽입삭제 시간복잡도 질문

0

9

1

Kaggle 노트북(predict.ipynb) 관련

0

7

0

처음 에이전트 설정을 잘못 했을 경우 수정 하는 방법

0

9

1

강의 연장 문의

0

8

1

수강 신청 연장 문의드립니다.

0

19

1

26년2회 실기기출은 언제쯤...

0

25

2

재귀함수 종료조건

0

10

1

git bash .env

1

12

1

예제 001 실행 안됩니다.

0

15

3

ipython 설치가 안되는거 같습니다.

0

11

1

이론 공부법 요약본 버전 업데이트 문의

0

23

2

프로그램은 뭘 사용하시는 건가요??

1

52

2

예측에 사용하는 경제지표의 활용에 대해

1

60

2

강의 자료를 어디서 확인 할 수 있나요?

1

72

3

주가 예측 정확도

1

212

2

섹션4의 10강 질문이 있습니다.

1

112

2

세션 3까지 듣고 궁금한점이 있어 문의 드립니다,

0

128

2

파이썬 스크립트 작성 프로그램은 뭘로 쓰시는건가요?

1

399

2

DB에 데이터 넣지 않는 이유가 무엇때문인가요?

1

139

1

국내시장용으로 제작하려면 어떻게 해야하나요?

0

182

2

feature 질문 드립니다.

0

90

2

노션 및 수업자료(코드) 다운로드는 어떻게 하나요?

1

246

2

주식 종목 추가

0

304

1