inflearn logo
강의

Course

Instructor

[Side Project After Work] Big Data Analysis Certification Practical Exam (Type 1, 2, 3)

12th Previous Exam Type (Task Type 2)

데이터 전처리 순서 관련

Resolved

13

yeonhwalim033758

5 asked

0


안녕하세요. 강의 잘 듣고있습니다 !


작업형 2 전처리 순서 관련해서 질문드립니다.

타겟 데이터 분리, 검증 데이터 분리, 인코딩, 스케일링을 모두 해야 할 때 일반적으로 권장되는 순서가 따로 있는지 궁금합니다.

강의에서는타겟 분리 → 인코딩 → 검증 데이터 분리순서로 진행한 경우가 있었는데, 반대로타겟 분리 → 검증 데이터 분리 → 인코딩순서로 진행해도 되는지 궁금합니다.

또한 스케일링은 어느 단계에서 진행하는 것이 적절한지도 궁금합니다.


제가 이해하기로는 pd.get_dummies()는 검증 데이터 분리 전에 적용해도 되는 경우가 있는 반면, StandardScaler는 데이터 누수 방지를 위해 검증 데이터를 먼저 분리한 뒤 학습 데이터에만 fit하고, 검증 데이터에는 transform만 적용하는 것으로 알고 있습니다.

혹시

를 함께 설명해주시면 감사하겠습니다.

python 머신러닝 빅데이터 pandas 빅데이터분석기사

Answer 2

0

roadmap

강의 잘 듣고 계시다니 감사합니다 😊
순서가 정해진 건 아니고, 순서가 달라져도 됩니다. 저도 코딩때마다 다르나
자격증을 준비하는 수험생에게는 한 두 가지 방법을 알려드리고 있어요.

만약 더 깊이 공부한다면 순서를 외우기 보다 각 작업의 이해가 필요합니다.
순서는 자격증 시험을 위한 용도입니다.


예를 들어 타겟을 꼭 먼저 분리해야하는 것도 아니에요!

그런데 타겟이 분리되지 않은채로 인코딩이나 스케일링을 하게 되면 타겟 데이터가 달라질 수 있는데

이를 처리하는 코드가 더 늘어나게 되어 최대한 코드를 적게 쓰면서 작업하는 방식으로 설명드리고 있어요!


검증 데이터 분리 → 인코딩으로 진행하면 코드가 더 많아집니다. train, val, test 세 가지를 모두 인코딩해야 해요.

데이터 누수에 대해서도 잘 알고 계시네요! 말씀하신 방식(학습 데이터에만 fit, 검증 데이터에는 transform)이 실무에서는 필요하지만, 시험은 시험으로 접근하시는 게 좋습니다. 복잡하거나 코드가 더 늘어나는 방식은 설명하지 않고 있는 점 양해 부탁드립니다.

스케일링은 우리가 사용하는 트리 계열 모델(랜덤포레스트, LightGBM)이 스케일링에 크게 영향을 받지 않기 때문에 시험에서는 생략하셔도 괜찮습니다.

정리하면 시험에서는 타겟 분리 → (결측치 처리) → (스케일링) → 인코딩 → 검증 데이터 분리 → 모델 학습 순서를 추천드려요!
그 외 작업은 가능한 만큼 시도해 주시면 되겠습니다.


  • train과 test의 범주가 다를 때: 각각 따로 get_dummies를 하면 컬럼 수가 달라져서 예측할 때 에러가 납니다. 이때는 train과 test를 합쳐서 인코딩한 뒤 다시 나눠 주세요. (이 또한 데이터 리키지 문제는 있지만 코드는 평가하지 않고 있습니다)


  • 선형 계열 모델을 쓸 때: 로지스틱 회귀, 선형 회귀, KNN, SVM 같은 모델은 스케일링 영향을 크게 받기 때문에 스케일링을 꼭 해주시는 게 좋습니다.

  • 스케일링 대상: 스케일링은 수치형 컬럼에만 적용합니다. 인코딩 전에 스케일링을 하는 이유도 원-핫 인코딩으로 만들어진 0/1 컬럼까지 스케일링되지 않게 하기 위해서예요.


화이팅입니다.

0

communityai8509

안녕하세요, 인프런 AI 인턴입니다. 도비님.

전처리 순서는 시험 목적이라면 강의에서 사용하는 흐름을 따라도 되지만, 데이터 누수를 엄격히 방지하려면 검증 데이터를 먼저 분리한 뒤 학습 데이터 기준으로 전처리하는 것이 안전합니다.

일반적으로는 다음과 같이 정리할 수 있습니다.

  1. 타겟 데이터 분리

    y = train.pop('target')
    
  2. 학습 데이터와 검증 데이터 분리

    X_train, X_val, y_train, y_val = train_test_split(
       train, y, test_size=0.2, random_state=42
    )
    
  3. 전처리

    • StandardScaler, MinMaxScaler 등은 X_train에만 fit
    • X_val과 테스트 데이터에는 transform만 적용
    scaler.fit(X_train[num_cols])
    X_train[num_cols] = scaler.transform(X_train[num_cols])
    X_val[num_cols] = scaler.transform(X_val[num_cols])
    
  4. 모델 학습 및 평가

  5. 테스트 데이터 예측 및 제출 파일 생성

StandardScaler처럼 평균, 표준편차 등의 통계값을 계산하는 전처리는 검증 데이터의 정보가 학습 과정에 섞이지 않도록 검증 데이터 분리 후 학습 데이터에만 fit하는 것이 원칙입니다.

반면 pd.get_dummies()는 단순히 범주형 데이터를 컬럼으로 변환하는 과정이므로 강의와 같이 검증 데이터 분리 전에 적용하는 경우도 있습니다. 다만 train과 validation 또는 train과 test의 범주형 값이 서로 다르면 컬럼이 달라질 수 있으므로, 인코딩 후 컬럼을 맞추거나 train과 test를 합쳐 인코딩하는 방식이 필요할 수 있습니다.

강의 답변에서도 시험에서는 전처리 및 스케일링을 검증 데이터 분리 전에 한 번에 진행해도 큰 의미의 차이는 없으며, 초보자라면 강의의 방식을 따라가는 것을 추천한다고 안내하고 있습니다.

관련 답변을 참고해 주세요.

정리하면 다음과 같습니다.

  • 가장 원칙적인 순서: 타겟 분리 → 검증 데이터 분리 → 학습 데이터 기준 전처리 fit → 검증/테스트 데이터 transform
  • pd.get_dummies(): 검증 데이터 분리 전에 적용할 수도 있지만, 변환 후 컬럼을 맞춰야 함
  • 스케일링: 데이터 누수 방지를 위해 학습 데이터에만 fit
  • 실기 시험에서 가장 안전한 방법: 강의의 기본 템플릿을 우선 익히고, 스케일링을 사용하는 경우에는 학습 데이터에만 fit하는 방식으로 작성
  • 랜덤포레스트와 같은 트리 계열 모델에서는 스케일링의 효과가 크지 않으므로, 시간이 부족하다면 인코딩과 결측치 처리 등 필수 전처리를 우선하는 것이 좋습니다.

저는 질문자님의 이해를 돕고자 지식공유자님의 기존 답변을 참고하여 유사한 답변 링크를 추천해드리고 있습니다.
현재 베타 기능으로 답변이 만족스럽지 않을 수 있는 점 양해 부탁드립니다. 🙏
추가적으로 궁금한 점이 있으시면, 이어서 질문해 주세요. 곧 지식공유자께서 답변해 주실 것입니다.

object 컬럼이 여러 개인 경우 인코딩 전처리 방법

0

9

2

작업형2 모의문제 데이터 불러오기

0

16

2

강의 연장 부탁드립니다!

0

15

1

수강기간 연장 문의드립니다!

0

39

1

2회 기출유형(작업형1) Warning

0

57

2

describe()

0

43

2

수강기간 연장 문의

0

71

2

빅데이터분석기사 실기 인코딩

0

63

2

수강기간 연장문의

0

67

2

수강 기간 연장 문의 드립니다.. 부탁드립니다 ㅠㅠ

0

55

2

작업형2와 3의 목적

0

40

1

기출9회(작업형 1의 2번문제)

0

41

2

수강 기간 연장 문의 드립니다.

0

59

2

수강 연장 문의드립니다

0

80

2

수강 연장 문의드립니다.

0

52

2

재결제 가능할까요...

0

61

1

비전공자 빅분기 실기 공부방법

1

73

2

강의일시정지 요청합니다

0

63

2

강의 연장 가능할까요 ㅠㅠ

0

60

2

수강 연장 문의드립니다.

0

66

2

수강기간 연장 가능 여부 문의드립니다.

0

83

1

수강 기간 연장 가능 여부 문의드립니다

0

85

2

강의 업데이트

0

83

2

수강 연장 문의드립니다.

0

102

2