173만명의 커뮤니티!! 함께 토론해봐요.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
제가 푼 내용을 보면 pred = rf.predict(test) : 질문자 pred = rf.predict(x_val) : 해설 위 두가지가 다릅니다. 해당 건 때문에 pred 했을 때, 값 차이가 많이 나는건가요? ㅜ_ㅠ 챗gpt에 물어보니 어떨때는 test고 어떨대는 x_val인지 아직도 모르겠습니다. # 라이브러리 및 데이터 불러오기 import pandas as pd train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_test.csv") # train.info() # test.info() target = train.pop('TotalCharges') train = pd.get_dummies(train) test = pd.get_dummies(test) train, test = train.align(test, join='left', axis=1) from sklearn.model_selection import train_test_split x_tr, x_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state=0) rf.fit(x_tr, y_tr) pred = rf.predict(test) submit = pd.DataFrame({'pred' : pred}) submit.to_csv('result.csv', index=False) ans = pd.read_csv('result.csv') print(ans)
python 머신러닝 빅데이터 pandas 빅데이터분석기사
wlysh999
2025-05-08T09:37:38.261Z
댓글 2
좋아요 0
조회수 77
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
'age' 컬럼의 이상치(소수점 나이와 음수나이, 0포함)를 제거하고 제거 전 후의 views 컬럼 표준편차를 더하시오 (최종 결과 값은 소수 둘째자리까지 출력, 셋째자리에서 반올림) 제가 생각한 이상치 제거는 1. 사분위수를 이용해서 1차적으로 이상치를 제거하고 1번을 통해 필터링 된 데이터에서 0, 음수, 소수 데이터를 제거 라고 생각했는데 아닌가요? 답은 우연인지 의도인지 둘다 8420.69 이 나오긴 했습니다 import pandas as pd df = pd.read _csv( " https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv " ) bef = df[ 'views' ].std() #1 #0, 음수 제거 -> 소수 제거 # opt6_1 = df['age'] <= 0 # df= df[~opt6_1] # opt6_2 = df['age'] % 1 == 0 # df = df[opt6_2] # aft = df['views'].std() # print(round(bef+aft, 2)) ###### 8420.69 출력 #2 # 이상치 제거 -> 0,음수 제거 -> 소수제거 Q1 = df[ 'age' ].quantile( 0.25 ) Q3 = df[ 'age' ].quantile( 0.75 ) IQR = Q3 - Q1 cond1 = df[ 'age' ] > Q3 + ( 1.5 * IQR) df = df[~cond1] cond2 = df[ 'age' ] < Q1 - ( 1.5 * IQR) df = df[~cond2] cond3 = df[ 'age' ] <= 0 df = df[~cond3] cond4 = df[ 'age' ] % 1 == 0 df = df[cond4] aft = df[ 'views' ].std() print ( round (aft + bef, 2 )) ###### 8420.69 출력
python 머신러닝 빅데이터 pandas 빅데이터분석기사
홍상환
2025-05-08T08:16:41.294Z
댓글 1
좋아요 0
조회수 56
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
len함수로 세서 나누기 2를 하는 코드로 알려주셨는데 len(df)*0.5) 이렇게 작성해도 될까요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
이선희
2025-05-08T05:00:33.178Z
댓글 2
좋아요 0
조회수 125
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
시험환경에서는 문제가 최소 최대 척도인데 강의에서 보이는 문제랑 다른데요.. 제가 잘 못들어간 것일까요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
이선희
2025-05-08T04:34:57.214Z
댓글 2
좋아요 0
조회수 99
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
풀이과정에서 iloc로 views가 세번째로 큰 도시를 출력해내는데 실제 시험에서는 정답만 기입하면 되는데 혹시 iloc로 구하지않고 육안으로 답을 알아보면 굳이 저렇게 까지 진행하지 않아도 될까요? 아니면 출력하는 마지막 코드까지 완성을 해둬야 하는걸까요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
이선희
2025-05-08T02:04:16.632Z
댓글 2
좋아요 0
조회수 60
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
test_id=test['id'] test = test.drop(['id'],axis=1) 이렇게 해도 괜찮나요??
python 머신러닝 빅데이터 pandas 빅데이터분석기사
현우
2025-05-07T21:42:49.237Z
댓글 2
좋아요 0
조회수 58
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
결과가 이런식으로 나오면 성공한건가요?? 추가로 id컬럼 정렬이나 y_test 비교 roc 점수가 88%면 합격일지도 궁금합니다 ㅠ
python 머신러닝 빅데이터 pandas 빅데이터분석기사
현우
2025-05-07T21:37:21.042Z
댓글 2
좋아요 0
조회수 64
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선생님 연습을 하는데 코랩에서 코드가 자동으로 입력되서 연습하는데 방해가 되는거같아서요ㅜㅜ 도구 -> 편집기 -> 컨텍스트 기반 코드 완성 표기 체크를 껐는데도 코드가 생길때는 어떻게 해야하나요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
강샛별
2025-05-07T05:06:03.770Z
댓글 2
좋아요 0
조회수 134
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
마지막 강의 영상 <정리>부분에서 데이터 불러오기 X_train = pd.read _csv(" https://raw.githubusercontent.com/lovedlim/inf/main/p2/data_atype/X_train.csv ") y_train = pd.read _csv(" https://raw.githubusercontent.com/lovedlim/inf/main/p2/data_atype/y_train.csv ") X_test = pd.read _csv(" https://raw.githubusercontent.com/lovedlim/inf/main/p2/data_atype/X_test.csv ") 데이터 분리 n_train = X_ train.select _dtypes(exclude='object').copy() n_test = X_ test.select _dtypes(exclude='object').copy() c_train = X_ train.select _dtypes(include='object').copy() c_test = X_ test.select _dtypes(include='object').copy() 수치형 민맥스 스케일 cols = ['age', 'fnlwgt', 'education.num', 'capital.gain', 'capital.loss', 'hours.per.week'] from sklearn.preprocessing import MinMaxScaler scaler = MinMaxScaler() n_train[cols] = scaler.fit _transform(n_train[cols]) n_test[cols] = scaler.transform(n_test[cols]) 라벨인코딩 cols = ['workclass', 'education', 'marital.status', 'occupation', 'relationship', 'race', 'sex', ' native.country '] from sklearn.preprocessing import LabelEncoder le = LabelEncoder() for col in cols: le = LabelEncoder() c_train[col] = le.fit _transform(c_train[col]) c_test[col] = le.transform(c_test[col]) 이 부분에서 이러한 에러가 납니다.. --------------------------------------------------------------------------- TypeError Traceback (most recent call last) ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in _encode(values, uniques, encode, check_unknown) 112 try: --> 113 res = _encode_python(values, uniques, encode) 114 except TypeError: ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in _encode_python(values, uniques, encode) 60 if uniques is None: ---> 61 uniques = sorted(set(values)) 62 uniques = np.array(uniques, dtype=values.dtype) TypeError: '<' not supported between instances of 'str' and 'float' During handling of the above exception, another exception occurred: TypeError Traceback (most recent call last) <ipython-input-95-295cc9604042> in <module> 7 for col in cols: 8 le = LabelEncoder() ----> 9 c_train[col] = le.fit_transform(c_train[col]) 10 c_test[col] = le.transform(c_test[col]) ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in fit_transform(self, y) 254 """ 255 y = column_or_1d(y, warn=True) --> 256 self.classes_, y = _encode(y, encode=True) 257 return y 258 ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in _encode(values, uniques, encode, check_unknown) 115 types = sorted(t.__qualname__ 116 for t in set(type(v) for v in values)) --> 117 raise TypeError("Encoders require their input to be uniformly " 118 f"strings or numbers. Got {types}") 119 return res TypeError: Encoders require their input to be uniformly strings or numbers. Got ['float', 'str']
python 머신러닝 빅데이터 pandas 빅데이터분석기사
보리과자
2025-05-07T02:54:06.290Z
댓글 1
좋아요 0
조회수 81
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
노트북 빈칸으로 먼저 문제를 풀이하는 중에 결측값 처리를 행을 삭제하는 방식으로 처리하였습니다. 맨 마지막 y_test와 r2계수를 구하는 과정에서 삭제된 행만큼의 데이터가 맞지 않아 오류가 났는데 실제 실기 시험에서도 결측치가 있는 행을 삭제하면 안되는 것인가요?? 결측치는 반드시 다른 값으로 대체 해야 하는 것 인가요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
hara0203
2025-05-06T15:25:05.612Z
댓글 1
좋아요 0
조회수 71
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 작업형2번 문제를 풀때 라벨인코딩하기 전이 정확도가 더 높으면 라벨인코딩이랑 one-hot 인코딩하기 전 baseline만 처리 한 후에 결과물을 제출하면되는걸까요? 실제 시험에서도 baseline만 처리하고 다른 라벨링을 안해도 되는지 문의드립니다!
python 머신러닝 빅데이터 pandas 빅데이터분석기사
hi
2025-05-06T13:56:04.220Z
댓글 2
좋아요 0
조회수 85
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
빅분기 실기 제3유형 점수배분 문의드립니다. 제가 알기로는 제3유형이 30점인데 1-1, 1-2, 1-3 이렇게 있으면 각 1문제당 5점씩으로 반영되나요? 확인 해주시면 감사하겠습니다.
python 머신러닝 빅데이터 pandas 빅데이터분석기사
wlysh999
2025-05-06T10:45:36.530Z
댓글 2
좋아요 0
조회수 328
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
강의와 동일한 코드에서 이렇게 에러가 발생하는데 원인 알 수 있을까요? . 이 아니라 , 로 제대로 입력하고 아무리 해봐도 에러가 납니다. 혹시나 해서 print(a)로 해봐도 동일합니다
python 머신러닝 빅데이터 pandas 빅데이터분석기사
buzil12
2025-05-06T08:22:15.342Z
댓글 2
좋아요 0
조회수 78
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요 listbox 예제 관련해서 마지막 앞 단어 할 때 listbox[-2]만 해도 나오는데 이렇게 해도 상관없을까요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
수석
2025-05-06T07:29:22.354Z
댓글 2
좋아요 0
조회수 79
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
문제에는 gender가 1인 확률이라고 명시하지 않았는데 왜 model.predict(test)<0.5하면 왜 틀리나요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김대현
2025-05-06T05:49:24.646Z
댓글 2
좋아요 0
조회수 75
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
7회 작업형 3문제를 보면 glm('종소변수 ~ 독립변수1 + 독립변수2 + 독립변수3', data=df).fit() 이런식으로 작성하던데 분산분석에서는 ols('종속변수 ~ 독립변수1*독립변수2') 이렇게 하던데 어떨 때 독립변수를 +만 하는지, 어떨 때 독립변수를 *하는지 헷갈립니다.
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김대현
2025-05-06T04:58:41.766Z
댓글 2
좋아요 0
조회수 73
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
아래 문제해설을 보니 pred = rf.predict(X_val) 로 반영 pred = rf.predict(test) 로 반영해도 문제없나요? # 랜덤포레스트 from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=0) rf.fit(X_tr, y_tr) pred = rf.predict(X_val) f1_score(y_val, pred, average='macro')
python 머신러닝 빅데이터 pandas 빅데이터분석기사
wlysh999
2025-05-05T23:23:05.311Z
댓글 2
좋아요 0
조회수 100
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요. 마지막에 저희 행/열 확인하잖아요. 거기에서 2154 , 1이 나오는데 답변 행 : 2154 test 행 : 2154 동일하다는 걸 검증하는거죠? <class 'pandas.core.frame.DataFrame'> RangeIndex: 2154 entries, 0 to 2153 Data columns (total 10 columns): # Column Non-Null Count Dtype --- ------ -------------- ----- 0 ID 2154 non-null int64 1 Gender 2154 non-null object 2 Ever_Married 2154 non-null object 3 Age 2154 non-null int64 4 Graduated 2154 non-null object 5 Profession 2154 non-null object 6 Work_Experience 2154 non-null float64 7 Spending_Score 2154 non-null object 8 Family_Size 2154 non-null float64 9 Var_1 2154 non-null object dtypes: float64(2), int64(2), object(6) memory usage: 168.4+ KB ID pred 0 458989 2 1 458994 3 2 459000 3 3 459003 3 4 459005 1 ... ... ... 2149 467950 4 2150 467954 4 2151 467958 2 2152 467961 2 2153 467968 4 [2154 rows x 2 columns]
python 머신러닝 빅데이터 pandas 빅데이터분석기사
wlysh999
2025-05-05T23:03:30.926Z
댓글 2
좋아요 0
조회수 59
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요. 제2회 기출, 제2유형 아래와같이 풀어봤는데 확인 부탁드립니다. 랜포활용 검증안함 검증은 어차피 시험에 반영안되고, 랜포밖에 할 줄 몰라서 이것만 암기했어요. 도저히 다른거 풀 자신이 없어서 시험 제2유형의 모든문제는 아래 패턴으로 진행하려합니다. 혹시 이렇게 진행해도되는지 문의드립니다. # 데이터 불러오기 import pandas as pd test = pd.read_csv("X_test.csv") train = pd.read_csv("X_train.csv") y_train = pd.read_csv("y_train.csv") X_train.shape, y_train.shape, X_test.shape # train.info() # test.info() # y_train.info() target = y_train.pop('Reached.on.Time_Y.N') train = pd.get_dummies(train) test = pd.get_dummies(test) train, test = train.align(test, join='left', axis = 1) from sklearn.model_selection import train_test_split x_tr, x_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state = 0) rf.fit(x_tr, y_tr) pred = rf.predict_proba(test) test_ID = test.pop('ID') submit = pd.DataFrame({'ID' : test_ID, 'Reached.on.Time_Y.N' : pred[:,1]}) submit.to_csv('result.csv', index=False)
python 머신러닝 빅데이터 pandas 빅데이터분석기사
wlysh999
2025-05-05T22:32:00.826Z
댓글 1
좋아요 0
조회수 78
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
기출2회, 제2유형의 해설 관련 저는 아래 랜포사용해서 진행했는데, 아래와 같이 predic_proba 사용했으므로 1차원 배열로 바꿔줘야하나요? DataFrame 'pred' : pred[:,1] 해줘야 1차원으로 변경되는지 문의드립니다. from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state = 0) rf.fit(x_tr, y_tr) pred = rf.predict_proba(test) test_ID = test.pop('ID') submit = pd.DataFrame({'ID' : test_ID, 'Reached.on.Time_Y.N' : pred[:,1]}) submit.to_csv('result.csv', index=False) # 랜덤포레스트 model = RandomForestClassifier(random_state=2022) model.fit(X_tr, y_tr) pred = model.predict_proba(X_val) print(roc_auc_score(y_val, pred[:,1]))
python 머신러닝 빅데이터 pandas 빅데이터분석기사
wlysh999
2025-05-05T22:30:15.086Z
댓글 2
좋아요 0
조회수 80