inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

173만명의 커뮤니티!! 함께 토론해봐요.

작업형 2유형 코드 점검 한번만 부탁드립니다..

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

import pandas as pd train = pd.read _csv("data/customer_train.csv") test = pd.read _csv("data/customer_test.csv") # 사용자 코딩 # print(train.shape, test.shape) # print( train.info ()) # print(test.isnull().sum()) y_train = train.pop('총구매액') # print(train.shape, test.shape) m = train['환불금액'].mean() train['환불금액'] = train['환불금액'].fillna(m) test['환불금액'] = test['환불금액'].fillna(m) # 원핫, 라벨링인코더 # print( train.info ()) # print(train.shape, test.shape) #라벨인코더 # cols = ['주구매상품', '주구매지점'] # from sklearn.preprocessing import LabelEncoder # le = LabelEncoder() # for col in cols: # train[col] = le.fit _transform(train[col]) # test[col] = le.transform(test[col]) #원핫 print(train.shape, test.shape) data = pd.concat([train,test], axis = 0) data_oh = pd.get_dummies(data) train = data_oh.iloc[:len(train)].copy() test = data_oh.iloc[len(train):].copy() print(train.shape, test.shape) # print(train.head()) #스플릿 from sklearn.model_selection import train_test_split X_tr, X_var, y_tr, y_var = train_test_split(train, y_train, test_size = 0.15, random_state = 0) #랜포 from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state=0) rf.fit (X_tr, y_tr) pred = rf.predict(X_var) import lightgbm as lgb lgbmr = lgb.LGBMRegressor(random_state=0) lgbmr.fit (X_tr, y_tr) pred1 = lgbmr.predict(X_var) from sklearn.metrics import root_mean_squared_error rmse = root_mean_squared_error(y_var, pred1) print(rmse) #라벨 rf 716.2595627489613 #라벨 lgb 667.9290102574973 #원핫 rf - 762.9476701424611 #원핫 lgb - 652.1802049238468 #제출 pred = lgbmr.predict(test) submit = pd.DataFrame({'pred' : pred}) submit.to _csv('result.csv', index=False) print( pd.read _csv('result.csv')) 저렇게 4개 비교해서 원핫 lgb로 제출했는데요 옳게 했는지 코드 점검 한번만 부탁드립니다 그리고 질문이 있는데요 실제 시험 들어가면 import pands as pd랑 트레인 테스트 저거 주나요? 외워야하나요? 저 화면 처럼 실제 시험도 저렇게 구성되어있나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
황증조 댓글 2 좋아요 0 조회수 118

데이터 이상치 파악

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

train과 test 데이터 전처리 시, 두 데이터 모두에서 '총구매액' 과 '최대구매액'이 음수이길래 이상치인줄 알고 전처리에 고민을 좀 했습니다. 고민하다보니 전액 환불한 경우에는 논리적으로 음수가 맞더라고요. 그래서 별도의 이상치 처리는 안 했습니다. 다만, 제가 궁금한점은 실제 시험에서 이상치가 나왔을 때 대응 방법 (예를 들어, 이상치가 아닌 데이터만 살리는 등) 이 문제처럼 test데이터에서 이상치가 나올 가능성이 있는지와 대응방법 (test데이터의 행은 삭제해서는 안 되는 것으로 알고 있습니다.) 위 두가지가 궁금합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
gkxncu 댓글 2 좋아요 0 조회수 107

기출3회 작업형2

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

예측 단계에서 다음과 같은 오류가 발생했는데, 이유가 뭘까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
shs4166 댓글 2 좋아요 0 조회수 62

[기출3회 작업형1 3번]

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

ValueError Traceback (most recent call last) /usr/local/lib/python3.11/dist-packages/pandas/core/indexes/range.py in get_loc(self, key) 412 try: --> 413 return self._range.index(new_key) 414 except ValueError as err: ValueError: 3 is not in range The above exception was the direct cause of the following exception: KeyError Traceback (most recent call last) 3 frames /usr/local/lib/python3.11/dist-packages/pandas/core/indexes/range.py in get_loc(self, key) 413 return self._range.index(new_key) 414 except ValueError as err: --> 415 raise KeyError(key) from err 416 if isinstance(key, Hashable): 417 raise KeyError(key) KeyError: 3 기출3회 작업형1 3번 문제를 풀 때, 맨 처음 데이터를 다시 실행시켜주지 않으면 동일한 코드라도 이런 오류가 뜹니다. 매번 처음 데이터를 실행해줘야하나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
shs4166 댓글 2 좋아요 0 조회수 64

9회 실기 1

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 방법 2인 pivot table을 만든 이후에 기존 방법 1의 grouped['차이'] 항목을 만들어 처리하였는데요. 방법 2에서는 grouped라는 변수에 pivot table 결과를 안넣으셨는데, pivot table 결과가 어떻게 grouped에 들어간걸까요??

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
jesung83 댓글 2 좋아요 1 조회수 150

2:00 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

대응표본검정 코딩할때, alternative='less'를 넣었는데 뮤d가 < 0 인 대립가설을 기준으로 잡으신 이유가 있을까요 ?? 귀무가설을 기준으로 뮤d >= 0 으로 잡으면 before가 after보다 크게 나와서 less로 안해도 된다는 의문점이 있습니다

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
dnrwls9115 댓글 2 좋아요 0 조회수 65

소문제 3번의 equal_var 값이 True임을 어떻게 확인하나요?

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

두 그룹이 등분산이라고 문제에 나와있지 않은 것 같은데 미리 구한 것인지 궁금합니다. 감사합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이건 댓글 1 좋아요 0 조회수 118

인코딩 (수치형 or 범주형) 선택

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요. 데이터 전처리 단계에서 저는 수치형 데이터를 넣어서 진행하였습니다. 하지만 수업에서는 범주형 데이터를 선택하여 인코딩을 하셨습니다. 이 기준을 어떻게 정한건가요?? 저는 info()를 통하여 df를 확인해보니 수치형(int,float)이 많아서 num_cols로 만들어서 진행하였습니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
hong8265 댓글 2 좋아요 0 조회수 84

3유형은 왜 빠져있는건가요?!

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 3유형은 기출6회부터 변경돼서 출제된건가요 ? 5회까지는 3유형이 안보여서요... 잘 몰라서 여쭙습니다

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
찌찌찌누 댓글 2 좋아요 0 조회수 98

작업형 2번 결측치 처리

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요, 작업형2 번에서 train, test 두 데이터 동일 컬럼에 결측치가 있을경우 숫자면 0 , 문자면 최빈값으로 채우는 방법도 있지만..연습문제 풀다 가끔 train, test 컬럼 수? 뭐가 안맞는다는 오류가떠서.. 해당 결측치 컬럼은 train과 test에서 제거해버려도 문제가 안될까요? ( 결측치 있는 컬럼이 Target이 아니라는 전제하에)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
홍영준 댓글 2 좋아요 0 조회수 72

pvalue값 형태?가 다르게 나와요

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강의에서는 코드 실행하면 pvalue 값만 나오지만 제가 코랩에서 실행하면 pvalue=np.float64()형태로 나오는데 시험 상황에서 상관 없을까요?? 실기 시험 장소에서는 버전이 낮아서 상관 없으려나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김예환 댓글 2 좋아요 0 조회수 71

2회 기출유형(작업형1) 3번 문항 질문있습니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강의와 다르게 cond1 , cond2 변수 순서를 바꿔서 출력했더니 값이 다르게 나오는데 이게 어떤 부분에서 문제가 있는걸까요? (또는) 함수에서 낮은 값부터 쓰지 않아서 그런건가요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이상윤 댓글 2 좋아요 0 조회수 54

강의나 교재에서는 넘파이 거의 다루지 않았지만

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

체험 3유형이 바뀐걸 보니 넘파이의 기본 기능을 좀 익히고 응시하면 대비가 되지 않을까 싶은데요 넘파이에 대한 기본 설명강의 간략하게 가능하실까요 아님 자료라도 ㅠㅠ(시나공 교재도 구입했는데 여기에서도 넘파이 예제는 안보여서요)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이선희 댓글 2 좋아요 0 조회수 148

작업형2 질문

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강사님! 작업형 2에서 결측치를 어느 값으로 채우면 좋을지 1에 가까운 것을 선택해서 사용하면 된다고 하셨는데 그걸 판단하는 코드는 어떻게 작성하는지 알 수 있을끼요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김지수 댓글 2 좋아요 0 조회수 77

일원분산분석 내용 중 anova 테이블과 melt

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요. 유사한 질문을 찾아보았으나 의문이 해결되지 않아 질문드립니다. anova 테이블을 만들기 전 적합한 데이터 형태를 만들기 위해 melt 함수를 사용하시더라구요. anova 테이블을 만들 때 필요한 특정한 데이터 형태가 있는건가요? 왜 melt함수를 적용해 주어야 하는지 아직 이해하지 못해서 질문드려요. 답변 기다리겠습니다. 감사합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김현영 댓글 3 좋아요 0 조회수 89

체험환경 삽입모드

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요! 실기 체험환경에서 코드를 작성하는데 이전에 썼던 코드를 수정하려고 하니 삽입되지않고 덮어써져서 코드 수정하는데 어려움을 겪고있습니다! 혹시 덮어쓰기모드에서 삽입모드로 변경하려면 어떻게 해야되나요? 항상 감사합니다!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
노앙 댓글 1 좋아요 0 조회수 78

선생님하고 똑같이 작성했는데 rmse가 도저히 ㅠㅠ왜그런걸까요

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

라이브러리 및 데이터 불러오기 import pandas as pd train = pd.read_csv('https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p2/ch4/train.csv') test = pd.read_csv('https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p2/ch4/test.csv') # test.isnull().sum() #결측치 처리 필요함 Item_Weight//// Outlet_Size target=train.pop('Item_Outlet_Sales') # 결측치 처리 train['Item_Weight'] = train['Item_Weight'].fillna(train['Item_Weight'].mean()) train['Outlet_Size'] = train['Outlet_Size'].fillna(train['Outlet_Size'].mode()[0]) test['Item_Weight'] = test['Item_Weight'].fillna(train['Item_Weight'].mean()) test['Outlet_Size'] = test['Outlet_Size'].fillna(train['Outlet_Size'].mode()[0]) # train=train.drop('Item_Identifier',axis=1) # test=test.drop('Item_Identifier',axis=1) #다르므로 데이터 합친 후 레이블인코딩 하고 다시 train test로 나누기 combined=pd.concat([train,test]) #->그다음 레이블인코딩해보자 cols=train.select_dtypes(include="O").columns print(cols) from sklearn. preprocessing import LabelEncoder for col in cols: le=LabelEncoder() combined[col]=le.fit_transform(combined[col]) #->다시 데이터 train과 test로 나누자 train=combined.iloc[:len(train)].copy() test=combined.iloc[len(train):].copy() print(train.shape, test.shape) #train데이터분할하기 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val=train_test_split(train, target, test_size=0.2, random_state=100) # #모델구축(1) # from sklearn.ensemble import RandomForestRegressor # model=RandomForestRegressor(random_state=200) # model.fit(X_tr,y_tr) # pred = model.predict(X_val) #모델구축(2) import lightgbm as lgb model = lgb.LGBMRegressor(random_state=0, verbose=-1) model.fit(X_tr, y_tr) pred = model.predict(X_val) #성능평가 from sklearn.metrics import root_mean_squared_error from sklearn.metrics import mean_absolute_error from sklearn.metrics import r2_score from sklearn.metrics import mean_squared_error result=root_mean_squared_error(y_val,pred) print('RMSE:', result) result = mean_squared_error(y_val, pred) print('MSE:', result) result = mean_absolute_error(y_val, pred) print('MAE:', result) result = r2_score(y_val, pred) print('r2:', result)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이선희 댓글 2 좋아요 0 조회수 116

저는 RMSE값이 1099정도 나오는데 ㅠㅠ

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

랜덤포레스트회귀로 하였는데 rmse값이 1099정도 나오는데요 이정도는 차이가 큰것일까요

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이선희 댓글 2 좋아요 0 조회수 92

작업형2 모델 검증

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

선생님의 코딩 # LightGBM import lightgbm as lgb lg = lgb.LGBMClassifier(random_state=0, verbose=-1) lg.fit(X_tr, y_tr) pred = lg.predict(X_val) print("lightgbm") print(f1_score(y_val, pred, average='macro')) # 최종 제출 파일 (lightGBM) pred = lg.predict(test) result = pd.DataFrame({'pred':pred}) result.to_csv("result.csv", index=False) 저의 코딩 from lightgbm import LGBMClassifier lg = LGBMClassifier(random_state=0, verbose=-1) model = lg.fit(X_tr, y_tr) pred = model.predict(X_val) pred.shape f1_score(y_val,pred, average='macro') # basic # 0.9257472552209252 pred = lg.predict(test) submit = pd.DataFrame({'pred' : pred}) submit.to_csv('result.csv', index=False) pd.read_csv('result.csv') 여쭙고싶은 것은 선생님께서는 lg.fit을 어떤 변수에 넣지 않고 바로 학습시킨 뒤 그것으로 예측 및 검증을 하고 최종 test 예측까지 수행하시는데, 저는 lg.fit을 model이란 변수에 넣은뒤 예측 및 검증을하고, 최종적으로는 lg로 test 예측을 수행합니다. 혹시 이 차이에서 최종 예측성능에 차이가 생길까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이정균 댓글 2 좋아요 0 조회수 58

3회 기출유형 (작업형2) _ 제출형식에 관한 문의

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

교수님 안녕하십니까? 3회 기출유형 (작업형2)를 혼자 풀면서 심사위원분들께서 채점을 할 때, 사용자 코드를 보고 채점 코드를 변경하시는지 혹은 일괄적인 코드로 채점을 하시는지 궁금함이 생겼습니다. 궁금한 점 1) 테스트 데이터값을 예측할 때 -> pred = rf.predict_proba(test)[:,1] 로 하지 않고, -> pred = rf.predict_proba(test) 로 테스트 데이터를 예측한 이후, 아래와 같이 진행하면 심사위원분들이 유동적으로 채점 코드를 변경하시나요? test_index = test.index[:] test_index submit = pd.DataFrame({'index':test_index,'y-pred':pred[:,1]}) submit.to_csv('result.csv',index=False) pd.read_csv('result.csv') ※ 교수님이 주신 채점 코드를 아래와 같이 제 임의로 변경하면 채점이 되는것을 확인했습니다. roc_auc_score(y_test,pred) -> roc_auc_score(y_test,pred[:,1]) ※ 다만, 사용자 데이터를 보지않고 채점 코드를 일괄적으로 적용하면, 정해진 제출형식에 어긋나게 작성해서 0점을 받을까 걱정이되서 문의드립니다!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
wlsgur737 댓글 2 좋아요 0 조회수 88

인기 태그

인프런 TOP Writers

주간 인기글