묻고 답해요
158만명의 커뮤니티!! 함께 토론해봐요.
인프런 TOP Writers
-
미해결[입문자를 위한] 캐글로 시작하는 머신러닝 • 딥러닝 분석
numpy.ndarray 에러
'numpy.ndarray' object has no attribute 'predict'
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
target pop 관련
만약에 target 값이 object라면 데이터 전처리(인코딩)를 하기 전에 pop을 적용하는 것이 맞고, int형이면 데이터 전처리 후에 해도 되는 것인가요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
mse 평가 관련 질문
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요!질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요먼저 유사한 질문이 있었는지 검색해보세요MSE 불러와서 RMSE 함수를 시험장에서 생각 못할경우 그냥 print 안에서 **0.5 를 해도 될까요??
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
sklearn에 rmse 지원하는지?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요!질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요먼저 유사한 질문이 있었는지 검색해보세요rmse 쓸때 그냥 아래처럼 쓰면되나요?1.4v이상부터 된다는데, 시험장 환경을 몰라서요..from sklearn.metrics import root_mean_squared_error root_mean_squared_error(y_val,pred)추가로, mse로 변환할때,def rmse(y_true,y_pred)에서 y_true랑 y_pred 는 어디서 가져오는 값인가요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
시험을 볼 때 이면지를 사용할 수 있나요?
작업형1, 3 에서는 따로 답안 제출을 해야 되는데, 답안 제출란으로 넘어가면 메모장이 보이지 않습니다. 그래서 혹시나 하는 입력 실수를 방지하고자 이면지에 작성하고 답안 제출을 하고 싶은데... 이게 가능한지 궁금합니다.감사합니다.
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
6회 기출 작업형2 오류 파악
import pandas as pd train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/6_2/energy_train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/6_2/energy_test.csv") X_train = train.drop(['Heat_Load'], axis = 1) y_train = train['Heat_Load'] X_test = test from sklearn.preprocessing import LabelEncoder encoder = LabelEncoder() X_train['Roof'] = encoder.fit_transform(X_train['Roof']) X_test['Roof'] = encoder.transform(X_test['Roof']) X_train['Height'] = encoder.fit_transform(X_train['Height']) X_test['Height'] = encoder.transform(X_test['Height']) X_train['Orient'] = encoder.fit_transform(X_train['Orient']) X_test['Orient'] = encoder.transform(X_test['Orient']) num_columns = X_train.select_dtypes(exclude = 'object').columns from sklearn.preprocessing import MinMaxScaler scaler = MinMaxScaler() X_train[num_columns] = scaler.fit_transform(X_train[num_columns]) X_test[num_columns] = scaler.transform(X_test[num_columns]) from sklearn.model_selection import train_test_split X_train, X_val, y_train, y_val = train_test_split(X_train, y_train, test_size =0.2, random_state=2025) print(X_train.shape, X_val.shape, y_train.shape, y_val.shape) from sklearn.ensemble import RandomForestRegressor model = RandomForestRegressor() model.fit(X_train, y_train) y_val_pred = model.predict(X_val) ValueError: could not convert string to float: 'High'위와 같이 작성하였는데 해당오류가 뜹니다. 라벨인코딩은 진행하였는데 왜 오류가 발생할까요??.. 원핫인코딩을 진행해야하나요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
마인드맵 업데이트 된 것이 어디에 올라와있을까요?
마인드맵 업데이트 된 것이 어디에 올라와있을까요?
-
미해결[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
기출 6회 작업형 1 - 3번 질문
풀었을 때 2020년도는 11개의 월이 있고, 2021년도는 9개의 월밖에 없었습니다.왜 12로 나누나요?그냥 mean()해야하는거 아닌가요?학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요!질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요먼저 유사한 질문이 있었는지 검색해보세요
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
평가지표를 무시해도 되나요?
평가를 하지 않고 그냥 바로 예측해서 제출해도 된다고 여러번 말씀하신것 같은데roc_auc 일때만 제출할 pred가 pred_proba 임을 파악하는 용도로 사용하고 나머지는 그냥 무시해도 될까요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
기출유형 문제와 시험장에서의 문제 차이
기출유형 문제들을 아래와 같은 형태로 주시곤 했는데 시험장 문제와 아예 같은 문제인가요? 예를 들어 시험장에서도 아래 주어진 것처럼 데이터 목록, 예측할 컬럼들을 알려주는지 평가지표가 MAE면 (Mean Absolute Error) 이렇게 풀어서 나타내주는지 궁금합니다! 작업형2 - 통신사에서 고객에게 청구될 총 금액을 예측하시오.제공된 데이터 목록:churn_train.csv(훈련 데이터)churn_test.csv(평가용 데이터)예측할 컬럼: TotalCharges(총 청구액)학습용 데이터(churn_train.csv)를 이용하여 총 청구액을 예측하는 모델을 만든 후 이를 평가용 데이터(churn_test.csv) 에 적용해 얻은 예측값을 다음과 같은 형식의 CSV 파일로 생성하시오.제출 파일은 다음 1개의 컬럼을 포함해야 한다.pred: 예측된 총 청구액제출 파일명: ‘result.csv’제출한 모델의 성능은 MAE(Mean Absolute Error) 평가지표에 따라 채점한다.
-
미해결[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
한 가지 방법으로 풀기에서
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요!질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요먼저 유사한 질문이 있었는지 검색해보세요랜덤포레스트 분류 회기만 잘 구분하고인코딩은 원핫 인코딩으로만 진행해도 될까요?라벨인코딩도 해야할지 고민입니다.이전에 유니크가 너무 많으면 원핫인코딩이 오래걸려서 라벨 인코딩을 해야한다고 했던걸로 기억해서요
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형2에서 만약 데이터가 3개로 주어지면 concat 하고 작업하는 방법을 알려주셨는데
concat하는 데이터가 train데이터 두개로 나뉜것을 하나의 train으로 합치라는 뜻 맞나요? 주어지는 X_test데이터는 기존 연습하던데이터들처럼 그냥 test 데이터인거죠?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
예시문제 작업형 3(Ver.2025) 소문제 3번 질문
from scipy import stats result = stats.ttest_ind(df[cond1]['Resistin'], df[cond2]['Resistin'], equal_var = True) 안녕하세요!3번 소문제 질문에서'두 집단의 로그 리지스틴 값에 유의미한 차이가 있는지...' 라고 해서 ttest 시에도 로그 값을 사용해야 하는 줄 알았습니다.from scipy import stats result = stats.ttest_ind(np.log(df[cond1]['Resistin']), np.log(df[cond2]['Resistin']), equal_var = True)위 코드처럼요. 하지만 그렇지 않더라구요.혹시 왜 그런건지 설명 좀 부탁드려도 될까요?감사합니다.
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
모델에서의 상수항 처리
model.summary()하면 회귀 계수들이 나오는데회귀 계수 관하여 답을 제출할때는 상수항은 고려하지 않고 제하나요? 이질문을 드리는 이유는 기출8회 작업형3 문제와 캐글 문제 때문에 여쭈어봅니다기출8회 작업형3처럼 상수항은'독립변수'에 포함시키지 않는지이에따라 항상 상수항은 연산에대해서 포함시키지않는것인지하단 캐글 문제 처럼 회귀계수 중 가장 큰값 같은 문제에서 상수항 계수가 제일 큰데 이러면 상수항 회귀계수를 내는것인지 # 모든 변수를 사용하여 OLS 모델을 적합하고, 회귀계수 중 가장 큰 값은? from statsmodels.formula.api import ols formula = 'y~x1+x2+x3+x4' model = ols(formula, data = data).fit() print(model.summary()) print(model.params[1:].max()
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
2번 관련해서
1-2 번 관련해서 궁금한게 있는데 idxmax( ) 가 가장 큰 거 반환해주는걸로 알고 있는데 idxmax(axis = 1 ) 을 사용하면 컬럼이 7 개 나오는데 그게 연도별로 가장 높은걸 반환해주는걸로 이해했습니다. 근데 어떤 원리인지 잘 모르겠어요
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형 2유형 변수 삭제
실제 시험 작업형 2유형에서설명력이 낮은 변수를 삭제하거나결측치나 이상치가 있는 데이터를 준다면 결측치를 제거하거나이런것에 기준이 있을까요?제가 문제를 읽어보고 임의로 결정해서 삭제를 해야할까요 아니면 문제에 있는 모든 변수(고유한ID컬럼제외)를 포함해서 학습해야할까요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
귀무,대립가설
대립가설과 귀무가설은 대응표본검정의 모든 문제에서 동일한 설정인가요 ?? 귀무가설: 뮤d >= 0 대립가설: 뮤d <0 2. 그리고 정규성 검정(샤피로윌크)할 때 df['diff'] = df['after'] - df['before']로 항상 계산하는건가요 ??대응표본검정은 뮤d가 before- after였는데 뮤d와 diff값은 아예 다른값이라고 생각하면 되는걸까요 ??
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
8회 작업형2 원핫인코딩
기출 8회 작업형2 내용 중원핫인코딩을 하는 부분이 있는데먼저 cols에 train의 object타입 컬럼을 담아놓고train = pd.get_dummies(train,columns=cols) test = pd.get_dummies(test,columns=cols)이런식으로 작성을 하는데,다른 영상에서는 columns=cols 이 부분을 안 넣는 것도 본 것 같아서요!저 구문의 의미와 넣었을 때와 안 넣었을 때의 차이점이 궁금합니다!
-
미해결[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형 2 파일 생성전 pred 순서에 오류
안녕하세요 8회 작업형 2번을 간단한 방법을 풀다가 오류가 발생했는데 도통 뭐 잘못작성한지 모르겠습니다..확인 부탁드리겠습니다! import pandas as pd train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_test.csv") # print(train.shape, test.shape) # train.head() # train.isnull().sum() # train = train.drop('CustomerID', axis = 1) # tesT = test.drop('CustomerID', axis = 1) target = train.pop('TotalCharges') # cols = train.select_dtypes(include = 'O').columns # # print(cols) # from sklearn.preprocessing import LabelEncoder # for col in cols : # le = LabelEncoder() # train[col] = le.fit_transform(train[col]) # test[col] = le.transform(test[col]) train = pd.get_dummies(train) test = pd.get_dummies(test) from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state = 0) # print(X_tr.shape, X_val.shape, y_tr.shape, y_val.shape) # from sklearn.ensemble import RandomForestRegressor # rf = RandomForestRegressor(random_state = 0) # rf.fit(X_tr, y_tr) # pred = rf.predict(X_val) # print(pred) # 937.577739684466 import lightgbm as lgb model = lgb.LGBMRegressor(random_state = 0, verbose=-1) model.fit(X_tr,y_tr) pred = model.predict(X_val) # 946.7024808036148 from sklearn.metrics import mean_absolute_error print(mean_absolute_error(y_val, pred)) pred = model.predict(test) submit = pd.DataFrame({'pred':pred}) submit.to_csv('result.csv',index = False) # result = pd.read_csv('result.csv')
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
pd.to_datetime 적용시 오류 문의
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요!질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요먼저 유사한 질문이 있었는지 검색해보세요df['날짜']=pd.to_datetime(df['날짜']) df['연도']=df['날짜'].dt.year 으로 변환해서 짜고 싶은데, 오류가 나는 이유가 뭘까요?