172만명의 커뮤니티!! 함께 토론해봐요.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요 강사님! 작업형2유형 질문이 있어서 글 남깁니다. pd.get_dummies 함수를 사용하면 컬럼수가 10개인것이 200개, 300개로 증가하는 경우가 있습니다. 문제가 없는건지 궁금합니다! concat 함수 말고 test = test.reindex(columns = train.columns, fill_value =0) 으로 train컬럼수와 test 컬럼수를 일치시켜도되는걸까요? 그리고 전처리 후 학습 및 평가를 할때 강사님께서는 train 데이터를 두개로 분리해서 80%로만 학습시키고, 20%로 예측 후 평가하시는 걸로 알고 있습니다. 이후 test 데이터를 예측할 때는 train 데이터 80% 학습한 모델을 통해 예측하는 걸로 이해했습니다. 만약 train 데이터 분리와 평가과정을 건너뛴다면, train 데이터 전체로 학습하고 test 데이터를 예측하는건데, 이부분은 상관이 없는걸까요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
권재경
2025-11-25T00:59:40.717Z
댓글 2
좋아요 0
조회수 53
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
혹시 실제 시험문제가 다 이런식으로 세팅되어서 이에 맞게 풀라고 되어있나요? 오히려 처음부터 작성하면 괜찮은데 이런 세팅이 있으니까 너무 헷갈려서요..
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김서현
2025-11-24T21:39:44.930Z
댓글 1
좋아요 0
조회수 55
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
concat해서 train과test를 나누는 경우는 어떤 경우인가요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김서현
2025-11-24T21:27:38.238Z
댓글 2
좋아요 0
조회수 45
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train.drop('output', axis=1), train['output'], test_size=0.15, random_state=2022) 이런식으로 안 하고 전처리 과정에서 y = train.pop으로 해도 되나요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김서현
2025-11-24T20:06:05.427Z
댓글 2
좋아요 0
조회수 48
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
이렇게 오류가 나는데 rmsle는 사용이 안 되는데 어떻게 하나요 r2는 큰게 좋다고 하시고 나머지는 작아야 좋다고 했는데 이렇게 나오는 경우 어떻게 하나요? 3. linearRegresssion은 random_state가 불가능인가요? 제공해주신 노트에는 다 랜덤값이 고정되있지 않읃데 0으로 고정하는게 맞는 거죠?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김서현
2025-11-24T19:41:51.764Z
댓글 2
좋아요 0
조회수 47
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요. 작업형2 검증 데이터 분리 부분에서 radom_state에 아무 값이나 넣어도 되는 것 맞나요? 예를 '작업형2모의문제2' 강의에서 선생님은 2022를 넣으셨고 저는 2025를 넣었는데 마지막 print(r2_score(y_test, pred)) 확인 부분에서 차이가 많이 나는 것 같아서요 (선생님 코드에서 결과: -0.03400981426239014 제가 실행한 결과: -0.013191699981689453)
python 머신러닝 빅데이터 pandas 빅데이터분석기사
geenangel
2025-11-24T18:20:41.867Z
댓글 2
좋아요 0
조회수 41
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김서현
2025-11-24T17:01:34.730Z
댓글 2
좋아요 0
조회수 56
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
삭제할지 다른 값으로 채울지 어떻게 결정하나요? 보통 문자이고 수가 많으면 삭제하는 게 더 나을까요? 수는 웬만하면 삭제보단 채우는 게 나을까요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김서현
2025-11-24T16:39:41.944Z
댓글 2
좋아요 0
조회수 60
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
CustomID를 삭제할 때 test 데이터에서도 완전히 삭제를 하는게 맞나요? train 데이터에서 삭제하는게 정석. 하지만 최종 파일 제출에 붙여야 하기 때문에 test 데이터에는 아래와 같이 pop함수를 를 써서 보관을 해둬야한다고 하셨던거 같아서요ㅜㅜ ex) test_id = test.pop('id')
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김다영
2025-11-24T16:27:50.764Z
댓글 2
좋아요 0
조회수 73
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
predict_proba로 제출한 이유는 뭔가요?? roc_auc를 제외하곤 나머지 평가지표를 구할필요가 없지 않나요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김서현
2025-11-24T16:24:10.497Z
댓글 3
좋아요 0
조회수 81
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
해당 코드를 실행하면 다음과 같이 데이터가 결합됩니다 ... ㅠㅠ
python 머신러닝 빅데이터 pandas 빅데이터분석기사
구름
2025-11-24T16:20:01.735Z
댓글 1
좋아요 0
조회수 42
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
lightgbm을 사용하지 않는 이유는 뭔가요? random보다light가 더 높게 나오는데 둘 다 사용해버ㅏ야 하는 거 아닌가요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
김서현
2025-11-24T16:17:54.873Z
댓글 2
좋아요 0
조회수 56
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
# 결측치 처리(범주형) c_cols = ['Model', 'Series', 'Processor', 'Processor_Gen', 'Hard_Disk_Capacity', 'OS'] train[c_cols] = train[c_cols].fillna("X") test[c_cols] = test[c_cols].fillna("X") # 결측치 처리(수치형) n_cols = ['RAM'] train[n_cols] = train[n_cols].fillna(-1) test[n_cols] = test[n_cols].fillna(-1) 1. 결측치 처리를 문제에서 결측치 처리 하라는 말 없어도 그냥 하는건가요? 2. 범주형은 문자열 X로 하는건가요? 그냥 하는건지? 3. 수치형은 -1로 한건가요? 왜 -1로 한건가요? # 원핫인코딩 combined = pd.concat([train, test]) combined_dummies = pd.get_dummies(combined) n_train = len(train) train = combined_dummies[:n_train] test = combined_dummies[n_train:] 4. 합쳐서 인코딩한게.. 그 오브젝트 유니크 수가 트레인이랑, 테스트가 달라서 한거 맞을까요? 제가 코딩한 거는 target=train.pop('Price') c_cols=['Model','Series','Processor', 'Processor_Gen', 'Hard_Disk_Capacity','OS'] train[c_cols]=train[c_cols].fillna("X") test[c_cols]=test[c_cols].fillna("X") n_cols=['RAM'] train[n_cols]=train[n_cols].fillna(-1) test[n_cols]=test[n_cols].fillna(-1) print(train.isnull().sum().sum()) print(test.isnull().sum().sum()) df=pd.concat([train, test]) df=pd.get_dummies(df) train=train.iloc[:len(train)] test=test.iloc[len(train):] from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) print(X_tr.shape, X_val.shape, y_tr.shape, y_val.shape) from sklearn.ensemble import RandomForestRegressor rf=RandomForestRegressor(random_state=0) rf.fit(X_tr, y_tr) pred=rf.predict(X_val) from sklearn.metrics import r2_score r2_score(y_val, pred) 이렇게했는데 ~~~~~~ (72, 9) (19, 9) (72,) (19,) --------------------------------------------------------------------------- ValueError Traceback (most recent call last) /tmp/ ipython-input-2530691866.py in <cell line: 0>() 31 from sklearn.ensemble import RandomForestRegressor 32 rf=RandomForestRegressor(random_state=0) ---> 33 rf.fit (X_tr, y_tr) 34 pred=rf.predict(X_val) 35 6 frames /usr/local/lib/python3.12/dist-packages/pandas/core/ generic.py in array (self, dtype, copy) 2151 ) -> np.ndarray: 2152 values = self._values -> 2153 arr = np.asarray(values, dtype=dtype) 2154 if ( 2155 astype_is_view(values.dtype, arr.dtype) ValueError: could not convert string to float: 'Lenovo' 이렇게 오류가 납니다 그전까지는 뭔가 잘 실행됐는데 랜덤포레스트이후??오류가 납니다
python 머신러닝 빅데이터 pandas 빅데이터분석기사
합격
2025-11-24T15:52:22.406Z
댓글 2
좋아요 0
조회수 63
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
이 문제에서 train과 test 합쳐서 원핫인코딩 combined = pd.concat([train, test]) combined_dummies = pd.get_dummies(combined) n_train = len(train) train = combined_dummies[:n_train] test = combined_dummies[n_train:] 한 이유가 city 컬럼에서 트레인 유니크 개수>테스트 유니크 개수라서 사용했다고 이해했는데,, 맞을까요? 2. 제가 코드 한거는 print(train.shape, test.shape) # print(train.isnull().sum()) # print(test.isnull().sum()) print( train.info ()) print( test.info ()) print(train.describe(include="O")) print(test.describe(include="O")) a=set(train['city']) b=set(test['city']) print(a-b) print(b-a) target=train.pop('target') df=pd.concat([train, test]) df=pd.get_dummies(df) train=train.iloc[:len(train)] test=test.iloc[len(train):] from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(target, train, test_size=0.2, random_state=0) print(X_tr.shape, X_val.shape, y_tr.shape, y_val.shape) from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=0) rf.fit (X_tr, y_tr) pred = rf.predict_proba(X_val) 이렇게 하니까 ~~~~~~ (12260,) (3066,) (12260, 13) (3066, 13) --------------------------------------------------------------------------- ValueError Traceback (most recent call last) /tmp/ ipython-input-1337250417.py in <cell line: 0>() 24 from sklearn.ensemble import RandomForestClassifier 25 rf = RandomForestClassifier(random_state=0) ---> 26 rf.fit (X_tr, y_tr) 27 pred = rf.predict_proba(X_val) 4 frames /usr/local/lib/python3.12/dist-packages/sklearn/utils/ validation.py in check_array(array, accept_sparse, accept_large_sparse, dtype, order, copy, force_writeable, force_all_finite, ensure_all_finite, ensure_non_negative, ensure_2d, allow_nd, ensure_min_samples, ensure_min_features, estimator, input_name) 1091 "if it contains a single sample." 1092 ) -> 1093 raise ValueError(msg) 1094 1095 if dtype_numeric and hasattr(array.dtype, "kind") and array.dtype.kind in "USV": ValueError: Expected a 2-dimensional container but got <class 'pandas.core.series.Series'> instead. Pass a DataFrame containing a single row (i.e. single sample) or a single column (i.e. single feature) instead. 이런 에러가 나옵니다ㅠ 분할까지는 했는데,, 랜덤포레스트부터 오류가 뜹니다
python 머신러닝 빅데이터 pandas 빅데이터분석기사
합격
2025-11-24T15:02:03.786Z
댓글 2
좋아요 0
조회수 61
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 선생님 roc-auc 는 프레딕프로바를 사용하면 좋다고하셨는데요. 제가 왕초보에다가 기간이 얼마 안남아서 혹시 그냥 predict로 통일해서 사용해도 괜찮을까요? 즉 40점 만점을 목표로 predict로 통일해도 predict proba와 유의미한 차이가 있을까요?
python 머신러닝 빅데이터 pandas 빅데이터분석기사
gamb21
2025-11-24T14:57:20.207Z
댓글 2
좋아요 0
조회수 53
미해결
한 입 크기로 잘라먹는 React.js 실전 프로젝트 - SNS 편
안녕하세요 강의 열심히 듣고 있는데 회원가입, 로그인 성공하고 요청 보낼 때 요청이 잘 들어왔다가 한 0.5초 뒤에 400에러로 바뀝니다. 코드는 모든 부분이 똑같은데 혹시 왜 이러는걸까요?? 의심가는 행동은 section05를 다 듣고 section06 폴더를 만들고 section05에서 사용한 파일을 그대로 복사하여 사용 중인데, 이 부분에서 문제가 있을까요?
react typescript react-query supabase zustand
프론취준생
2025-11-24T14:49:56.061Z
댓글 5
좋아요 0
조회수 125
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
df=pd.concat([train, test]) df=pd.get_dummies(df) train=train.iloc[:len(train)] test=test.iloc[len(train):] print(train.shape, test.shape) print로 컬럼 수 일치하는지 반드시 확인이라고 햇는데 어떤 컬럼수가 어떤거랑 일치해야하는거죠?? 아 그리고 이렇게 분리를 다시 했으면 train_test_split 이 코딩은 더 안해도되나요? 이것도 또 해야하나요? X_tr, X_val, y_tr, y_val 이요
python 머신러닝 빅데이터 pandas 빅데이터분석기사
합격
2025-11-24T14:31:35.956Z
댓글 2
좋아요 0
조회수 67
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
Section 3. 항공권 가격 예측 # 컬럼 삭제 train = train.drop('flight', axis=1) test = test.drop('flight', axis=1) 컬럼삭제한 이유는 무엇이죠? print(train.describe(include="O")) print(test.describe(include="O"))이걸 돌려봤는데 트레인에서 플라이트 유니트 1153 테스트에서 플라이트 유니크가 4502 이렇게 달라서 컬럼 삭제하는건가요? 어떨 때 컬럼 삭제해야하는지, 또 시험에 어떤 형식이 나올때 삭제해야하는지 궁금합니다 2.제가 코딩을 print(train.shape, test.shape) train=pd.get_dummies(train) test=pd.get_dummies(test) print(train.shape, test.shape) from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) print(X_tr.shape, X_val.shape, y_tr.shape, y_val.shape) 이렇게 했는데 (10505, 11) (4502, 10) (4502, 9) (4502, 10) (4502, 37) (4502, 930) --------------------------------------------------------------------------- ValueError Traceback (most recent call last) /tmp/ ipython-input-2712245612.py in <cell line: 0>() 20 print(train.shape, test.shape) 21 from sklearn.model_selection import train_test_split ---> 22 X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) 23 print(X_tr.shape, X_val.shape, y_tr.shape, y_val.shape) 3 frames /usr/local/lib/python3.12/dist-packages/sklearn/utils/ validation.py in check_consistent_length(*arrays) 473 uniques = np.unique(lengths) 474 if len(uniques) > 1: --> 475 raise ValueError( 476 "Found input variables with inconsistent numbers of samples: %r" 477 % [int(l) for l in lengths] ValueError: Found input variables with inconsistent numbers of samples: [4502, 10505] 이렇게 오류가 뜹니다
python 머신러닝 빅데이터 pandas 빅데이터분석기사
합격
2025-11-24T14:19:29.162Z
댓글 2
좋아요 0
조회수 41
미해결
한 입 크기로 잘라먹는 React.js 실전 프로젝트 - SNS 편
안녕하세요. 강의 듣다 질문 드리는데요 강의에서는 supabase를 사용하는데요 그러면 supabase가 아닌 다른 DB(Mysql, PostgreSQL 등) 를 사용한다면 auth.ts 는 다른 방식으로 사용을 해야 되나요? 아니면 별도의 인증 라이브러리가 있을까요?
react typescript react-query supabase zustand
kopti
2025-11-24T13:49:04.329Z
댓글 2
좋아요 0
조회수 155
미해결
실전도커: 도커로 나만의 딥러닝 클라우드 컴퓨터 만들기
주피터 실행 명령어 부분에서 동일하게 명령어를 실행했는데, PATH부터 HOME까지 여러 설정 정보들이 출력된 후 다시 터미널로 돌아옵니다. docker ps를 해보면 실행중인 컨테이너는 없고, 생성되었다가 바로 종료되는 것으로 보입니다. 왜 그런걸까요? 이미지 버전은 v163입니다. 추가로 명령어 부분에 /bin/bash -c "jupyter lab --ip=0.0.0.0 --port=8888 --allow-root --no-browser" 를 추가해보았는데요. 이때도 open browser를 클릭하면 localhost 로만 연결되며 제대로된 화면이 나오지 않고 있습니다. 로그를 보니 여러번 redirect 되더라구요. 토큰 인증이 되어있지 않다고 나와있는 것 같습니다. 아무튼 이 방법은 오픈 브라우저 요청은 뜨지만 강의처럼 클릭시 인증 화면이 뜨지 않고 있습니다.
python 딥러닝 linux docker azure 가상화 mlops
kyo lee
2025-11-24T13:47:02.176Z
댓글 3
좋아요 0
조회수 126