inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

173만명의 커뮤니티!! 함께 토론해봐요.

데이터 전처리 시 문의

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

데이터전처리에서 결측치로 인해 데이터들을 삭제하셨는데, 범주형 데이터는 : 아무 문자 "X"로 채우고 수치형 데이터는 : 평균값 혹은 중앙값으로 채워도 괜찮을까요? 무턱대고 DROP하면 큰일날 거 같아서...

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
personal_92 댓글 2 좋아요 0 조회수 74

random_state 값

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

random_state 값에 따라서 결과 값이 들쑥날쑥한데 어떻게 해결해야할까요 ? +- 5% 내에서 값이 달라지는 것 같습니다. 시험장에서는 아무숫자 대입해서 그 중 젤 나은 값으로 제출해도 무방할까요 ?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
personal_92 댓글 2 좋아요 0 조회수 71

인코딩 사용여부

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

인코딩 사용할 때 어떠한 기준으로 원핫인코딩 vs 라벨인코딩으로 진행해야할까요 ? 그냥 전처리할때는 only 원핫인코딩 적용해도 무방할까요 ?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
personal_92 댓글 2 좋아요 0 조회수 74

인코딩 전 데이터 합치기 질문드립니다!

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요. 2유형 관련 질문 드립니다! train 데이터와 test 데이터가 다를때 레이블인코딩 진행시 train의 종류가 test의 종류를 모두 포함했다면 데이터를 합치지 않아도 되고, 원핫인코딩을 할거라면 concat을 통해 데이터를 반드시 합친 후에 다시 분리해야 된다로 이해 했는데 맞을까요? train의 종류가 test를 모두 포함하지 못한다면 레이블인코딩에서도 데이터를 합친 후 다시 분리해야 할까요? 2유형 EDA을 하면서 아래와 같은 코드로 train과 test 데이터를 무조건 확인하고 진행하는것이 좋은 방법인지 궁금합니다. print(train.describe(include='O')) print(test.describe(include='O')) a = set(train['object컬럼'].unique()) b = set(test['object컬럼'].unique()) print(a - b) print(b – a) 모르는게 많아 질문이 길어졌습니다. 답변 감사합니다!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
한광욱 댓글 1 좋아요 0 조회수 90

섹션5. 회귀 강의 관련 질문드립니다

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

회귀 분석에서는 스케일링이 필요가 없나요? 혹은 데이터에 따라 다르다던지 별도의 기준이 있는걸까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
박찬웅 댓글 2 좋아요 0 조회수 64

수강기간연장 문의드립니다

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요~~강사님 어렵게 필기시험 합격하고 강의를 듣고 실기시험을 보려했으나 수술, 프로젝트 출장 등으로 실기시험을 접수만하고 시험장 한번 못가보았습니다 필기 2년이되어 이번이 마지막 기회라 마지막 실기 시험을 치고 싶은데 학습완료일이 5월 29일입니다 6월 시험까지 연장또는 한달만 추가 신청등 방법이 있는지 확인부탁드립니다 메일주소 pkhjjang99@gmail.com 항상 좋은 강의 고맙습니다

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
kyunghee park 댓글 2 좋아요 0 조회수 87

수강 연장 문의

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요. 현재 강의를 수강 중인 수강생입니다. 다름이 아니라 제가 11월 시험을 준비 중인데, 현재 강의 수강기간이 10월에 종료되어 시험 전까지 복습 및 학습을 이어가기 어려운 상황입니다. 시험 준비를 위해 강의를 계속 활용하고 싶어 혹시 가능하다면 수강기간을 11월 시험 일정까지 조금만 연장해주실 수 있을지 정중히 부탁드립니다. 번거로우시겠지만 검토 부탁드리며, 긍정적으로 고려해주시면 감사하겠습니다. 계정: ydk9476@gmail.com

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김도엽 댓글 2 좋아요 0 조회수 80

label 인코딩 에러 발생 원인

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 label 인코딩에서 train[cols] 확인하는 과정에서 자꾸 에러가 발생하는데 원인이 뭔지 알 수 있을까요? (12분 18초 입니다)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
댓글 2 좋아요 0 조회수 68

LabelEncoding 시 train data 학습(fit_transform, transform)

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

작업형2 모의문제 풀이에서 for col in cols: le = LabelEncoder() train[col]=le.fit_transform(train[col]) test[col]=le.transform(test[col]) 다음과 같이 코딩을 진행하셨는데, 이는 그 후 train을 split해서 학습 시 이미 fit_transfrom이 되어 데이터 누출이 되는 방법 아닌가요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
각나닫 댓글 2 좋아요 0 조회수 79

로지스틱 회귀분석은 옛날거 밖에 없나요?

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

로지스틱 회귀분석은 구버전 밖에 없나요? 신버전 찾고 있는데 못찾아서 보냅니다!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
anycallkjs 댓글 2 좋아요 0 조회수 100

판다스 표 표시

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

판다스에서 시리즈 만들때 저는 화면처럼 표 형식이 아니라 이런식으로 표시되는데, 해결방법이 있을까요

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이번엔가즈아 댓글 3 좋아요 0 조회수 67

1유형 강의 다 나간 후 어떻게 할까요?

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

일단 1유형 강의는 다들었고 모의고사 15번까지 풀어봤는데 나머지 강의에 없는 16~39까지 다 풀고 2~3유형 갈지 아니면 일단 강의 다 듣고 나머지 모의고사를 스스로 풀어보는 쪽이 좋은지 살짝 고민되어서 쪽지 드려요.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이광현(Lte1) 댓글 2 좋아요 0 조회수 70

점수차가 많이 나는데 따로 하신게 있으신가요?

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 선생님 선생님 인강 보면서 기출을 풀어보면서 시험에 대비하고 있습니다. 근데 기출 5회에서 2유형 선생님의 baseline과 제 baseline 수치가 너무 달라서 이렇게 Q&A를 보냅니다. 선생님 baseline(랜포)은 1296이 나오는데 제가 한 baseline(랜포)은 1400대가 나옵니다 혹시 제가 뭘 잘 못한게 있는지 궁금합니다 아래는 제가한 코드입니다! #eda print('\n====데이터 크기=====') print(train.shape,test.shape) print('\n====데이터 정보=====') print(train.info()) print('\n====train 결측치=====') print(train.isnull().sum()) print('\n====test 결측치=====') print(test.isnull().sum()) print('\n====카테고리=====') cols=train.select_dtypes(include='O').columns for col in cols: set_train=set(train[col]) set_test=set(test[col]) same=set_train==set_test if same: print(col,'O') else: print(col,'X') print('\n====타겟 기초 =====') print(train['price'].describe()) # 전처리 target=train.pop('price') train=pd.get_dummies(train) test=pd.get_dummies(test) # print(train.shape,test.shape) #검증 from sklearn.model_selection import train_test_split X_tr,X_val,y_tr,y_val=train_test_split(train,target,test_size=0.2,random_state=42) print(X_tr.shape,X_val.shape,y_tr.shape,y_val.shape) # rf from sklearn.ensemble import RandomForestRegressor rf=RandomForestRegressor(random_state=42) rf.fit(X_tr,y_tr) pred=rf.predict(X_val) #학습 from sklearn.metrics import root_mean_squared_error print('===rf===') print(root_mean_squared_error(y_val,pred)) #lg import lightgbm as lgb lg=lgb.LGBMRegressor(random_state=42,verbose=-1) lg.fit(X_tr,y_tr) pred=lg.predict(X_val) print('==lg==') print(root_mean_squared_error(y_val,pred)) #lr from sklearn.linear_model import LinearRegression lr=LinearRegression() lr.fit(X_tr,y_tr) pred=lr.predict(X_val) print('==lr==') print(root_mean_squared_error(y_val,pred)) #결과 pred=lg.predict(test) submit=pd.DataFrame({'pred':pred}) submit.to_csv('result.csv', index=False)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
anycallkjs 댓글 2 좋아요 0 조회수 73

작업형1 모의문제 4번에 3)문제 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 강사님 정답이 views_min=df.iloc[:10]['views'].min df.iloc[:10, -1]=views_min 인데, df=df.iloc[0:10] df['views']=df['views'].min() 이렇게 쓰면 안될까요??

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
연정 댓글 2 좋아요 0 조회수 54

이상치 전처리 작업

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 강사님 다름아니라 2과목 중 데이터 전처리에서 이상치 관련 질문있습니다. 제가 강의를 듣었을 때는 이상치를 데이터의 현실적 한계성으로 판단하신거로 이해하였습니다. ex( age 컬럼은 음수가 될 수 없다.) 제가 예전에 학교에서는 이상치를 quantile을 통해 IQR값을 추출하고 그 추출한 값을 바탕으로 이상치를 판단했었던 기억이 있습니다. 그렇기에 빅데이터분석기사에서 이상치 값을 판단할 때, IQR로 이상치를 판단 또한 하는게 맞을까요? 아니면 이 과정까지는 필요가 없을까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
Jeongman 댓글 2 좋아요 0 조회수 68

평가결과값 문의

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

초반에 target(output)을 pop을 이용해 분류하고 검증데이터 분할, 모델 생성/학습을 진행했습니다. roc-auc, f1score, accuracy 평가결과가 1.0 으로 나오는 이유는 뭘까요....? # 타켓설정 target = train.pop('output') # 검증데이터분할 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size = 0.15, random_state = 0) from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state = 0) rf.fit(X_tr, y_tr) pred = rf.predict(X_val) pred_proba = rf.predict_proba(X_val) from sklearn.metrics import roc_auc_score, f1_score, accuracy_score print(roc_auc_score(y_val, pred_proba[:, 1])) print(f1_score(y_val, pred)) print(accuracy_score(y_val, pred)) ----------------------------------- 1.0 1.0 1.0

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
ywldud1215 댓글 2 좋아요 0 조회수 59

시계열 데이터 날짜와 시간 format

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강사님, 안녕하세요. 해당 강의에서는 시간 format 파라미터 사용시 H만 대문자로 사용하면 된다고 하셨는데, e-book에서는 H:M:S 다 대문자로 되어야한다고 적혀있어서요. 어떤게 맞을까요???

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
연정 댓글 2 좋아요 0 조회수 88

평가지표 F1 스코어 질문드립니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요! F1 스코어 설명하시면서 average = micro, macro, weighted 중에 문제에서 요구하는데로 쓰면 된다고 하셨는데.. 만약 문제에서 제시된 평가지표가 F1 스코어가 아니지만 F1 스코어를 사용하려고 할 경우(문제에서 요구된게 없는 경우)에는 micro, macro, weighted 중 어떤걸 사용하면 될까요? 감사합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
한광욱 댓글 2 좋아요 0 조회수 69

작업형 2 기출7회분에서

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 혹시 선형회귀모델에서 rmse 값이 가장 낮게 나왔어서 모델을 선택하고 실제 test 데이터를 예측하는데, 이 과정에서 80프로의 train으로 학습한 모델이잖아요..? 나중에 train 자체 100프로를 재학습시킨 후 test 예측하는게 더 올바른 것인지.. 이 과정 없이 그동안 진행해온 부분으로 바로 test 예측하는게 좋은지 궁금해요!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
아기고앵 댓글 2 좋아요 0 조회수 70

작업형2 모의문제1 (30강)

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

수업에서는 수치형 데이터에 대한 스케일링을 미실시 하였고, 학습 모델도 랜덤포레스트로만 진행하였습니다. 수치형 데이터에 대해 StandardScaler, RobustScaler 등의 스케일링을 실시하고, lightgbm 모델도 학습을 했을 때 랜덤포레스트 모델보다 성능이 좋게 나왔습니다. 혹시 이 문제에서 스케일링을 하면 안되는 이유나 lightgbm으로 했을 때 발생할 수 있는 문제가 있을까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
danielcho0930 댓글 2 좋아요 0 조회수 60

인기 태그

인프런 TOP Writers

주간 인기글