inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

173만명의 커뮤니티!! 함께 토론해봐요.

기출8회 제2유형

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

제가 푼 내용을 보면 pred = rf.predict(test) : 질문자 pred = rf.predict(x_val) : 해설 위 두가지가 다릅니다. 해당 건 때문에 pred 했을 때, 값 차이가 많이 나는건가요? ㅜ_ㅠ 챗gpt에 물어보니 어떨때는 test고 어떨대는 x_val인지 아직도 모르겠습니다. # 라이브러리 및 데이터 불러오기 import pandas as pd train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_test.csv") # train.info() # test.info() target = train.pop('TotalCharges') train = pd.get_dummies(train) test = pd.get_dummies(test) train, test = train.align(test, join='left', axis=1) from sklearn.model_selection import train_test_split x_tr, x_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state=0) rf.fit(x_tr, y_tr) pred = rf.predict(test) submit = pd.DataFrame({'pred' : pred}) submit.to_csv('result.csv', index=False) ans = pd.read_csv('result.csv') print(ans)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
wlysh999 댓글 2 좋아요 0 조회수 77

6번 질문입니다

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

'age' 컬럼의 이상치(소수점 나이와 음수나이, 0포함)를 제거하고 제거 전 후의 views 컬럼 표준편차를 더하시오 (최종 결과 값은 소수 둘째자리까지 출력, 셋째자리에서 반올림) 제가 생각한 이상치 제거는 1. 사분위수를 이용해서 1차적으로 이상치를 제거하고 1번을 통해 필터링 된 데이터에서 0, 음수, 소수 데이터를 제거 라고 생각했는데 아닌가요? 답은 우연인지 의도인지 둘다 8420.69 이 나오긴 했습니다 import pandas as pd df = pd.read _csv( " https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv " ) bef = df[ 'views' ].std() #1 #0, 음수 제거 -> 소수 제거 # opt6_1 = df['age'] <= 0 # df= df[~opt6_1] # opt6_2 = df['age'] % 1 == 0 # df = df[opt6_2] # aft = df['views'].std() # print(round(bef+aft, 2)) ###### 8420.69 출력 #2 # 이상치 제거 -> 0,음수 제거 -> 소수제거 Q1 = df[ 'age' ].quantile( 0.25 ) Q3 = df[ 'age' ].quantile( 0.75 ) IQR = Q3 - Q1 cond1 = df[ 'age' ] > Q3 + ( 1.5 * IQR) df = df[~cond1] cond2 = df[ 'age' ] < Q1 - ( 1.5 * IQR) df = df[~cond2] cond3 = df[ 'age' ] <= 0 df = df[~cond3] cond4 = df[ 'age' ] % 1 == 0 df = df[cond4] aft = df[ 'views' ].std() print ( round (aft + bef, 2 )) ###### 8420.69 출력

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
홍상환 댓글 1 좋아요 0 조회수 56

데이터 50퍼센트 추출 코드에서

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

len함수로 세서 나누기 2를 하는 코드로 알려주셨는데 len(df)*0.5) 이렇게 작성해도 될까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이선희 댓글 2 좋아요 0 조회수 125

views의 세번째로 큰 도시를 구할때?

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

풀이과정에서 iloc로 views가 세번째로 큰 도시를 출력해내는데 실제 시험에서는 정답만 기입하면 되는데 혹시 iloc로 구하지않고 육안으로 답을 알아보면 굳이 저렇게 까지 진행하지 않아도 될까요? 아니면 출력하는 마지막 코드까지 완성을 해둬야 하는걸까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이선희 댓글 2 좋아요 0 조회수 60

id컬럼 삭제

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

test_id=test['id'] test = test.drop(['id'],axis=1) 이렇게 해도 괜찮나요??

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
현우 댓글 2 좋아요 0 조회수 58

작업형 2 질문드립니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

결과가 이런식으로 나오면 성공한건가요?? 추가로 id컬럼 정렬이나 y_test 비교 roc 점수가 88%면 합격일지도 궁금합니다 ㅠ

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
현우 댓글 2 좋아요 0 조회수 64

코랩 자동글쓰기

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선생님 연습을 하는데 코랩에서 코드가 자동으로 입력되서 연습하는데 방해가 되는거같아서요ㅜㅜ 도구 -> 편집기 -> 컨텍스트 기반 코드 완성 표기 체크를 껐는데도 코드가 생길때는 어떻게 해야하나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
강샛별 댓글 2 좋아요 0 조회수 134

라벨 인코딩에서 오류가 납니다..

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

마지막 강의 영상 <정리>부분에서 데이터 불러오기 X_train = pd.read _csv(" https://raw.githubusercontent.com/lovedlim/inf/main/p2/data_atype/X_train.csv ") y_train = pd.read _csv(" https://raw.githubusercontent.com/lovedlim/inf/main/p2/data_atype/y_train.csv ") X_test = pd.read _csv(" https://raw.githubusercontent.com/lovedlim/inf/main/p2/data_atype/X_test.csv ") 데이터 분리 n_train = X_ train.select _dtypes(exclude='object').copy() n_test = X_ test.select _dtypes(exclude='object').copy() c_train = X_ train.select _dtypes(include='object').copy() c_test = X_ test.select _dtypes(include='object').copy() 수치형 민맥스 스케일 cols = ['age', 'fnlwgt', 'education.num', 'capital.gain', 'capital.loss', 'hours.per.week'] from sklearn.preprocessing import MinMaxScaler scaler = MinMaxScaler() n_train[cols] = scaler.fit _transform(n_train[cols]) n_test[cols] = scaler.transform(n_test[cols]) 라벨인코딩 cols = ['workclass', 'education', 'marital.status', 'occupation', 'relationship', 'race', 'sex', ' native.country '] from sklearn.preprocessing import LabelEncoder le = LabelEncoder() for col in cols: le = LabelEncoder() c_train[col] = le.fit _transform(c_train[col]) c_test[col] = le.transform(c_test[col]) 이 부분에서 이러한 에러가 납니다.. --------------------------------------------------------------------------- TypeError Traceback (most recent call last) ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in _encode(values, uniques, encode, check_unknown) 112 try: --> 113 res = _encode_python(values, uniques, encode) 114 except TypeError: ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in _encode_python(values, uniques, encode) 60 if uniques is None: ---> 61 uniques = sorted(set(values)) 62 uniques = np.array(uniques, dtype=values.dtype) TypeError: '<' not supported between instances of 'str' and 'float' During handling of the above exception, another exception occurred: TypeError Traceback (most recent call last) <ipython-input-95-295cc9604042> in <module> 7 for col in cols: 8 le = LabelEncoder() ----> 9 c_train[col] = le.fit_transform(c_train[col]) 10 c_test[col] = le.transform(c_test[col]) ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in fit_transform(self, y) 254 """ 255 y = column_or_1d(y, warn=True) --> 256 self.classes_, y = _encode(y, encode=True) 257 return y 258 ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in _encode(values, uniques, encode, check_unknown) 115 types = sorted(t.__qualname__ 116 for t in set(type(v) for v in values)) --> 117 raise TypeError("Encoders require their input to be uniformly " 118 f"strings or numbers. Got {types}") 119 return res TypeError: Encoders require their input to be uniformly strings or numbers. Got ['float', 'str']

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
보리과자 댓글 1 좋아요 0 조회수 81

작업형2 모의문제2

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

노트북 빈칸으로 먼저 문제를 풀이하는 중에 결측값 처리를 행을 삭제하는 방식으로 처리하였습니다. 맨 마지막 y_test와 r2계수를 구하는 과정에서 삭제된 행만큼의 데이터가 맞지 않아 오류가 났는데 실제 실기 시험에서도 결측치가 있는 행을 삭제하면 안되는 것인가요?? 결측치는 반드시 다른 값으로 대체 해야 하는 것 인가요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
hara0203 댓글 1 좋아요 0 조회수 71

작업형 2번 관련 질문드립니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 작업형2번 문제를 풀때 라벨인코딩하기 전이 정확도가 더 높으면 라벨인코딩이랑 one-hot 인코딩하기 전 baseline만 처리 한 후에 결과물을 제출하면되는걸까요? 실제 시험에서도 baseline만 처리하고 다른 라벨링을 안해도 되는지 문의드립니다!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
hi 댓글 2 좋아요 0 조회수 85

빅분기 실기 제3유형 점수배분

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

빅분기 실기 제3유형 점수배분 문의드립니다. 제가 알기로는 제3유형이 30점인데 1-1, 1-2, 1-3 이렇게 있으면 각 1문제당 5점씩으로 반영되나요? 확인 해주시면 감사하겠습니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
wlysh999 댓글 2 좋아요 0 조회수 328

print 에러 질문드립니다

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강의와 동일한 코드에서 이렇게 에러가 발생하는데 원인 알 수 있을까요? . 이 아니라 , 로 제대로 입력하고 아무리 해봐도 에러가 납니다. 혹시나 해서 print(a)로 해봐도 동일합니다

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
buzil12 댓글 2 좋아요 0 조회수 78

listbox 예제 관련

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 listbox 예제 관련해서 마지막 앞 단어 할 때 listbox[-2]만 해도 나오는데 이렇게 해도 상관없을까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
수석 댓글 2 좋아요 0 조회수 79

7회 작업형3 문제 1-3 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

문제에는 gender가 1인 확률이라고 명시하지 않았는데 왜 model.predict(test)<0.5하면 왜 틀리나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김대현 댓글 2 좋아요 0 조회수 75

logit()안에 들어가는 독립변수 관련 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

7회 작업형 3문제를 보면 glm('종소변수 ~ 독립변수1 + 독립변수2 + 독립변수3', data=df).fit() 이런식으로 작성하던데 분산분석에서는 ols('종속변수 ~ 독립변수1*독립변수2') 이렇게 하던데 어떨 때 독립변수를 +만 하는지, 어떨 때 독립변수를 *하는지 헷갈립니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김대현 댓글 2 좋아요 0 조회수 73

기출6회 제2유형

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

아래 문제해설을 보니 pred = rf.predict(X_val) 로 반영 pred = rf.predict(test) 로 반영해도 문제없나요? # 랜덤포레스트 from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=0) rf.fit(X_tr, y_tr) pred = rf.predict(X_val) f1_score(y_val, pred, average='macro')

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
wlysh999 댓글 2 좋아요 0 조회수 100

4회기출, 제2유형

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요. 마지막에 저희 행/열 확인하잖아요. 거기에서 2154 , 1이 나오는데 답변 행 : 2154 test 행 : 2154 동일하다는 걸 검증하는거죠? <class 'pandas.core.frame.DataFrame'> RangeIndex: 2154 entries, 0 to 2153 Data columns (total 10 columns): # Column Non-Null Count Dtype --- ------ -------------- ----- 0 ID 2154 non-null int64 1 Gender 2154 non-null object 2 Ever_Married 2154 non-null object 3 Age 2154 non-null int64 4 Graduated 2154 non-null object 5 Profession 2154 non-null object 6 Work_Experience 2154 non-null float64 7 Spending_Score 2154 non-null object 8 Family_Size 2154 non-null float64 9 Var_1 2154 non-null object dtypes: float64(2), int64(2), object(6) memory usage: 168.4+ KB ID pred 0 458989 2 1 458994 3 2 459000 3 3 459003 3 4 459005 1 ... ... ... 2149 467950 4 2150 467954 4 2151 467958 2 2152 467961 2 2153 467968 4 [2154 rows x 2 columns]

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
wlysh999 댓글 2 좋아요 0 조회수 59

제2회 기출, 제2유형

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요. 제2회 기출, 제2유형 아래와같이 풀어봤는데 확인 부탁드립니다. 랜포활용 검증안함 검증은 어차피 시험에 반영안되고, 랜포밖에 할 줄 몰라서 이것만 암기했어요. 도저히 다른거 풀 자신이 없어서 시험 제2유형의 모든문제는 아래 패턴으로 진행하려합니다. 혹시 이렇게 진행해도되는지 문의드립니다. # 데이터 불러오기 import pandas as pd test = pd.read_csv("X_test.csv") train = pd.read_csv("X_train.csv") y_train = pd.read_csv("y_train.csv") X_train.shape, y_train.shape, X_test.shape # train.info() # test.info() # y_train.info() target = y_train.pop('Reached.on.Time_Y.N') train = pd.get_dummies(train) test = pd.get_dummies(test) train, test = train.align(test, join='left', axis = 1) from sklearn.model_selection import train_test_split x_tr, x_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state = 0) rf.fit(x_tr, y_tr) pred = rf.predict_proba(test) test_ID = test.pop('ID') submit = pd.DataFrame({'ID' : test_ID, 'Reached.on.Time_Y.N' : pred[:,1]}) submit.to_csv('result.csv', index=False)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
wlysh999 댓글 1 좋아요 0 조회수 78

2회기출, 제2유형

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

기출2회, 제2유형의 해설 관련 저는 아래 랜포사용해서 진행했는데, 아래와 같이 predic_proba 사용했으므로 1차원 배열로 바꿔줘야하나요? DataFrame 'pred' : pred[:,1] 해줘야 1차원으로 변경되는지 문의드립니다. from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state = 0) rf.fit(x_tr, y_tr) pred = rf.predict_proba(test) test_ID = test.pop('ID') submit = pd.DataFrame({'ID' : test_ID, 'Reached.on.Time_Y.N' : pred[:,1]}) submit.to_csv('result.csv', index=False) # 랜덤포레스트 model = RandomForestClassifier(random_state=2022) model.fit(X_tr, y_tr) pred = model.predict_proba(X_val) print(roc_auc_score(y_val, pred[:,1]))

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
wlysh999 댓글 2 좋아요 0 조회수 80

인기 태그

인프런 TOP Writers

주간 인기글