inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

173만명의 커뮤니티!! 함께 토론해봐요.

범주형데이터 전처리 관련 문의드립니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요. EDA 단계에서 수치형컬럼들의 기초통계량을 해보니 SeniorCitizen이 0과 1로 나뉘어있는거 같아 변수 확인 후, 해당 컬럼을 범주형으로 변환 후, 작업하였는데 이렇게 변경하여 작업해도 괜찮을까요 ? 범주형으로 변경 후, 작업하였을 때 # 원핫인코딩 : 946.3475544795037 946.7024808036148 # 레이블인코딩 : 951.0960435538027 952.7925407798712 다음과 같이 결과 값이 나왔습니다. 감사합니다 :)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
bbororora9 댓글 2 좋아요 0 조회수 59

작업형2 탐색적 데이터 분석

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

작업형2에서 전처리 과정 들어가지전, EDA 수행 시 꼭 확인해야하는 것들이 어떤것이 있을까여?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
personal_92 댓글 2 좋아요 0 조회수 44

작업형1 모의문제1-2 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

# your code import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv") cols1 = df.columns[df.isnull().sum() >= len(df) * 0.3] df = df.dropna(subset=cols1) cols2 = df.columns[(df.isnull().sum() < len(df) * 0.3) & (df.isnull().sum() >= len(df) * 0.2)] for col in cols2: df[col] = df[col].fillna(df[col].mode()[0]) print(sum(df['f3'] == 'gold')) 문제에서 결측치가 30% 이상인 컬럼을 찾으라 했는데, 저는 이렇게 조건에 해당하는 컬럼들을 리스트 형태로 구해서 subset에 넘겨주었는데, 선생님 풀이를 보니 subset=['f1'] 이런 식으로 조건에 해당하는 컬럼의 이름을 직접 명시하셨더라구요..! 이런 문제를 풀 때 조건문을 이용해서 조건에 해당하는 컬럼들을 일괄적으로 선택할 필요는 없나요? 제가 아직 이 시험의 문제 유형을 잘 파악하지 못했는데, 이 시험이 혹시 코딩테스트를 예로 들면 "2+3의 값을 출력하시오" 라는 문제의 답을 print(2+3)이 아닌 print(5)로 써도 답은 맞으니 정답 처리가 되는 방식인가요? 감사합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
Jin 댓글 2 좋아요 0 조회수 52

작업형 2 모델, 평가, 예측

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

예를 들어 평가지표가 여러개인 경우 코드는 다 작성하고 바로 예측하면 되나요?? 평가랑 예측의 상관성을 잘 모르겠습니다. 보통 코드에 평가 지표를 여러개 작성하는데 그게 다 반영돼서 예측하는건가요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
최수영 댓글 2 좋아요 0 조회수 46

실행 실패했는데 봐주실 수 있으실까요? ㅠㅠ

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 퇴근후딴짓님! 다름 아니라 안내대로 작성했는데 계속 실행실패가 나와서 왜 그런것인지 궁금합니다 ㅠㅠ.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
랄랄라 댓글 2 좋아요 0 조회수 60

수치형 자료 선택

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

2유형 개념 강의 중 classification(분류) 문제 질문있습니다. label 인코딩 할 때 범주형 자료를 선택하기 위해 cols = train.select _dtypes(include='object')를 사용한다고 했습니다. 그 후 Min-Max 스케일링을 진행할 때 강의에서는 리스트 형태로 cols 변수에 직접 수치형 컬럼을 입력했지만 cols = train. select _dtypes (exclude= 'object' ) 또는 include=['int','float'] 으로도 선택할 수 있을 것을 것이라 생각해서 실행했더니 에러가 발생합니다. ValueError : Boolean array expected for the condition, not int64 제 방법대로 진행했을 때 cols에 선택된 데이터를 보면 강의에서 직접 리스트 형태로 입력한 컬럼에 추가로 'id' 컬럼이 더 선택된 것으로 보입니다. 이렇게 진행했을 때 왜 에러가 발생하는지, 에러가 발생하지 않아도 id 컬럼이 추가로 선택된 상태로 진행했을 때 문제가 있는지 질문 드립니다! 강의 내용 cols = ['age', 'fnlwgt', 'education.num', 'capital.gain', 'capital.loss', 'hours.per.week'] def get_data(): train_copy = train.copy() test_copy = test.copy() return train_copy, test_copy train_copy, test_copy = get_data() from sklearn.preprocessing import MinMaxScaler scaler = MinMaxScaler() display(train_copy[cols].head(2)) train_copy[cols] = scaler.fit_transform(train_copy[cols]) test_copy[cols] = scaler.transform(test_copy[cols]) display(train_copy[cols].head(2)) 제 코딩 내용은 위 코드에서 cols = ['age', 'fnlwgt', 'education.num', 'capital.gain', 'capital.loss', 'hours.per.week'] 부분을 cols = train.select_dtypes(include=['int','float']) 또는 cols = train.select_dtypes(exclude='object') 이렇게 바꿨습니다

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김하민 댓글 2 좋아요 0 조회수 49

예시문제 작업형3 소문제3번 등분산

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

등분산이라는 명확한 언급이 없어서 등분산이라고 가정하고 t검정을 수행하신건가요?? 분석 흐름 때문에 등분산이라고 생각하셨다고 하는데 구체적인 이유가 궁금합니다..!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
송지윤 댓글 3 좋아요 0 조회수 137

비교 연산자 == 의 해석이 어려워요

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

19강 작업형1 모의문제2 문제 6번에서 df['age']==round(df['age'],0) 위의 코드가 어떤 방식으로 왼쪽과 오른쪽 값이 같으면 '정수형'이고 다르면 '소수점'이라는 판단을 내릴 수 있건지 이해하기가 어렵습니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
민지 댓글 2 좋아요 0 조회수 45

데이터 프레임이 안만들어지네요

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

설명 주신대로 코드를 짜보았는데 데이터 프레임 출력이 되지 않네요. 다음 사진의 경고문이 뜨는데 이거 때문인건가요? 새로고침해봐도 안되네요. 해결 방법이 궁금합니다 감사합니다!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
semistone6239 댓글 3 좋아요 0 조회수 73

object형 컬럼 카테고리 비교

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강의에서 카테고리 비교할 수 있는 응용 코드를 알려주셨는데요, train과 test의 범주형 컬럼의 기초통계값을 확인해서 unique수 차이가 많이 난다면 카테고리 비교하는 과정없이 그냥 무조건 concat으로 합치고 레이블 인코딩 후 다시 분리해도 되나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
audreyjy 댓글 2 좋아요 0 조회수 76

오징어게임 챌린지

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

쿠폰 신청을 하려고 했는데 사용 가능 수량이 초과되었다고 문구가 뜹니다. 혹시 추가 쿠폰 지급 계획은 없으신지 문의드립니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
댓글 2 좋아요 0 조회수 56

하이퍼파라미터 필수여부

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

작업형 2번 에서, 하이퍼 파라미터 값은 필수로 넣어줘야 하나요? print로 성능 하나하나 체크 하고 넣어줘야하나요? 굳이 안넣더라도 채점에 영향이 없나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
JunSuPark 댓글 3 좋아요 0 조회수 86

17강 판다스 시계열데이터 풀이에서 100일째 되는 날

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세 요 여기서 왜 가운데에 10이 생긴걸까요? 제가 100일을 쓰기도 전에 10일 쓰고 모르고 실행하긴했는데 그래서 그런걸까요?//...

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김수진 댓글 2 좋아요 0 조회수 53

모델 & 평가 과정 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

랜덤포레스트 진행과정에서 전 강의에서는 pred_proba = rf.predict_proba(X_val) 쓰고, roc_auc = roc_auc_score(y_val, pred[:,1]) 이렇게 하셨는데 이번 강의에서는 roc_auc_score(y_val, pred_proba[:,1]) 로 표현하셨는데 어떤 차이로 인해서 다르게 쓰셨는지 문의드립니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
personal_92 댓글 2 좋아요 0 조회수 52

7. 예측 및 결과파일 생성에서 오류가 생겨요

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

다중분류(6회) 문제입니다. 선생님 해설지처럼 똑같이 쳤는데 마지막에 자꾸 오류가 뜨네요 왜그런지 모르겠어요 ㅠ

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
댓글 3 좋아요 0 조회수 94

작업형2 모의문제1 책관련

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

작업형2모의문제 1 같은 경우는 도서에 따로 문제가 없는 것일까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
personal_92 댓글 1 좋아요 0 조회수 44

작업형1 모의문제1 문제1

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

영상에서는 df.quantile(.75)를 실행했을 때 오류가 나지 않았는데 저는 오류가 나서 어떤 부분이 잘못되었는지 여쭤봅니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
bellong 댓글 2 좋아요 0 조회수 48

작업형2_예시문제 이상치 처리

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 작업형2 예시문제에서 이상치 처리 여부 관련하여 문의드립니다. train데이터의 총구매액과 최대구매액의 최소값이 음수로 되어있고, test데이터의 최대구매액의 최소값이 음수로 되어있는데 이 경우 이상치 처리를 하고 진행하는게 맞는건가요? test데이터의 레코드 수는 동일해야하는데 위와 같은 경우 이상치 처리를 해야한다면 어떻게 처리를 해야 하는지 궁금합니다. 감사합니다 :)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
bbororora9 댓글 2 좋아요 0 조회수 67

작업형 1. 모의문제 1 _ 문제 3번

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

모의문제 1의 문제 3번에서 df['f3']을 replace 함수 사용해서 값 변환해줄 때 굳이 numpy 불러오지 않고 하단처럼 구해도 되나요? 값은 133으로 똑같이 나왔습니다. #2. f3 컬럼의 결측치는 0, silver는 1, gold는 2, vip는 3 으로 변환한 후 총 합을 정수형으로 출력하시오 # print(df) df['f3'] = df['f3'].fillna(0) df['f3'] = df['f3'].replace('silver', 1) df['f3'] = df['f3'].replace('gold', 2) df['f3'] = df['f3'].replace('vip', 3) # print(df) print(int(sum(df['f3'])))

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
최수영 댓글 2 좋아요 0 조회수 49

작업형2 모의문제3

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강의에서 xgb로 test데이터를 predict하셨는데 성능평가가 더 우세해서 선정하신건지 궁금합니다! 수업 자료 노트북에선 랜덤 포레스트가 지표가 더 높더라구요 ㅠㅠ 랜덤 포레스트: roc-auc: 0.9409937888198757 accuracy: 0.8108108108108109 f1: 0.8444444444444444 xgb roc-auc: 0.9161490683229814 accuracy: 0.8108108108108109 f1: 0.8372093023255814

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
조윤진 댓글 2 좋아요 0 조회수 57

인기 태그

인프런 TOP Writers

주간 인기글