묻고 답해요
164만명의 커뮤니티!! 함께 토론해봐요.
인프런 TOP Writers
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
테스트 사이즈
테스트 사이즈를 나누는 기준이 있나요??작으면 0.15, 좀 크면 0.2이런식으로요
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
F 검정 및 로그, 합동 분산 추정량 공식 출현에 걱정됩니다...
선생님, 안녕하세요. 다름이 아니라, 제3유형의 출제범위가 생각보다 넓은 듯 하여 걱정입니다...F 값, 합동 분산 추정량, 로그 씌우는 함수 등... 배우지 못했거나 알지 못하는 개념 및 함수가 갑작스레 등장하게 될까 걱정이네요...어느정도까지 숙지해야하는지도 감이 안서 난감합니다...ㅠㅠ
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형2 3번 예시문제 관련 문의
import pandas as pd train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p2/heart/2files/train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p2/heart/2files/test.csv") # train = pd.read_csv("train.csv") # test = pd.read_csv("test.csv") print(train.shape, test.shape) target = train.pop('output') from sklearn.model_selection import train_test_split X_tr,X_val,y_tr,y_val = train_test_split(train,target,test_size=0.5,random_state=2022) print(X_tr.shape,X_val.shape,y_tr.shape,y_val.shape) from sklearn.ensemble import RandomForestClassifier model = RandomForestClassifier(random_state=2022,max_depth=5, n_estimators=400) model.fit(X_tr,y_tr) pred = model.predict_proba(X_val) from sklearn.metrics import roc_auc_score roc_auc = roc_auc_score(y_val,pred[:,1]) print(roc_auc)작업형2 3번 예시 문제에서 강의 스크립트와 동일하게 작성했는데 roc_auc 평가 결과가 1.0으로 나오게 됩니다.1로 나오는 결과는 모델이 검증 데이터를 완벽하게 예측하는 경우라고 하는데, 해당 스크립트 맞는지한번 봐주시면 감사하겠습니다!^^
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
기출 8회 작업형 2
문제를 라벨인코딩이 아닌 원핫인코딩으로 풀고 싶은데, 챗 gpt 에 물어봤더니, # 열 정렬/맞춤 필수 (시험 감점 포인트!)train, test = train.align(test, join='left', axis=1, fill_value=0)이 코드가 필수라고 해서요! 원핫인코딩을 할 떄는 항상 안전하게 이 코드를 작성해주면 좋을까요?아니면 이 문제의 경우 특히 그런걸까요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
탐색적 데이터 분석
저는 1.데이터 크기 확인print(train.shape,test.shape)2.결측치 수 print(train.isnull().sum())print(test.isnull().sum()) 3.#target unique 수print(train['Heat_Load'].value_counts())4.데이터 정보(자료형)print(train.info())정도만 확인 하는데 value_counts()로 확인하는 이유와 object의 unique개수를 확인 하는 이유가 뭔가요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
질문드립니다.
안녕하세요.3유형 관련하여, 문제가 주어지면 알아서 독립성/정규성/등분산성 까지 검증을 해야하는지 궁금합니다~! 예를 들면예) 과자의 무게는 200g과 다른지 검정하세요. 1.정규성 검정 (shapiro) 이후 결과에 따라willcoxon이나 ttest_1samp를 진행해야 하는 것인지. 2.그게 아니라면, 정규성은 주어지고willcoxon이나 ttest_1samp를 하라고 주어지는 것인지 궁금합니다.
-
해결됨남박사의 파이썬으로 봇 만들기 with ChatGPT
44, 45강 실행시 오류
그대로 따라하고 실행했는데 이런 문제점이 있습니다. 왜인지 잘 모르겠어요. 44강에서 테스트 메세지의 링크가 모바일에서도 안나옵니다. 44강에서 위치보기 도 누르면 아무 링크가 안열립니다. 45강에서 PC카톡에 "안녕하세요. 봇입니다." 라는 메세지를 보내면, 계속 이렇게 나오네요.
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
기출 3회 작업형2 lightgbm 질문
기출 3회 작업형2 lgbm으로 풀다가 질문드립니다 #lightgbm import lightgbm as lgb rk = lgb.LGBMClassifier(random_state=628, verbose=-1) rk.fit(X_tr, y_tr) 여기까지 했는데 LightGBMError: Do not support special JSON characters in feature name. 이렇게 오류가 뜨는 건 어떻게 해야하는 건가요??
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
머신러닝 분류 모델과 회귀모델의 종류
어떤게 있나요 헷갈려서 ex)분류모델-랜덤포레스트,Xgboost,LightGBM이런 식으로 정리 좀 해주세요
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
데이터 전처리 과정
강사님 안녕하세요데이터 전처리 과정에서 어떤 조건?으로 결측치를 제가하나요?여기서 이름과 host_id를 제거하신거같은데 이유가 있나요??그리고 모의문제1에서도 어떤 이유 저 컬럼을 없앤건지 궁금합니다
-
미해결[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
2회 기출유형 3번 문제
3번문제에 이렇게 코드를 짜봤는데 결과값이 다르게 나옵니다ㅠ 어디를 수정해야 할까요?ㅠq3 = df['age'].quantile(0.75) q1 = df['age'].quantile(0.25) IQR = q3 - q1 line1 = q1 - 1.5 * IQR line2 = q3 + 1.5 * IQR print(sum(df['age'] < line1)) print(sum(df['age'] > line2))
-
해결됨(2026) 일주일만에 합격하는 정보처리기사 실기
2025년 1회 기출문제 3/3 이론포함
12분 10초대부터 시작해서 a[0]가 0되면서 탈출조건 이렇게 말씀하시면서 0이라고 하시는데func(values, 0, 1) 여기서 st = 0, end = 1 인데탈출조건은 st >= end 0>= 1 이렇게 되면 탈출이 안되는거 아닌가여? 이해가 안됩니다
-
미해결[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
코드 검토
안녕하세요 혼자 문제 풀이를 해보다가 제가 작성한 코드들이 문제가 없는지 여쭤보고싶습니다.그리고 마지막 제출단계에서 test 데이터에 'Attritino_Flag'를 삭제했는데 (drop을 안시키고 작성했는데 오류가 뜨더니 자동으로 drop시키는 코드로 수정되었습니다.) 왜 삭제해야 오류가 안나는지 궁금합니다. # 1. 문제 정의 (분류) target: Atrrition_Flag(1: 이탈, 0: 유지) # 2. 데이터 불러오기 # 3. 탐색적 데이터 분석(EDA) # train.info() # dtypes: float64(5), int64(11), object(5) # train.isnull().sum() # 0 # train.describe(include='O') # test.info() # dtypes: float64(5), int64(10), object(5) # test.isnull().sum() # 0 # train['Attrition_Flag'].value_counts() # 0: 6815, 1: 1286 # 4. 데이터 전처리(인코딩, 데이터 전처리) # 4-1. 원핫인코딩 data = pd.concat([train, test], axis = 0) data = pd.get_dummies(data) train = data.iloc[:len(train)].copy() test = data.iloc[len(train):].copy() # train.info() # bool(23), float64(6), int64(10) # test.info() # bool(23), float64(6), int64(10) # 5. 검증 데이터 나누기 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split( train.drop('Attrition_Flag',axis=1), train['Attrition_Flag'], test_size = 0.2, random_state = 0 ) # 6. 모델 학습 및 평가 # 6-1. 모델불러오기 from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=0) # 6-2. 학습(fit) rf.fit(X_tr, y_tr) # 6-3. 예측(predict) pred = rf.predict(X_val) # 6-4. 예측 결과 확인 # pred[:10] # rf.classes_ # pred # 6-5. 평가 # 평가: ROC-AUC, 정확도(Accuracy), F1, 정밀도(Precision), 재현율(Recall) from sklearn.metrics import roc_auc_score, accuracy_score, f1_score, precision_score, recall_score accuracy = accuracy_score(y_val, pred) print('accuracy:',accuracy) # accuracy: 0.9549660703269587 f1 = f1_score(y_val, pred) print('f1:',f1) # f1: 0.8381374722838137 precision = precision_score(y_val, pred) print('precision:',precision) # precision: 0.9264705882352942 recall = recall_score(y_val, pred) print('recall:',recall) # recall: 0.7651821862348178 pred = rf.predict_proba(X_val) roc_auc = roc_auc_score(y_val, pred[:,1]) print('roc_auc:',roc_auc) # roc_auc: 0.9860421123349186 # 7. 제출 pred = rf.predict_proba(test.drop('Attrition_Flag', axis=1)) pred submit = pd.DataFrame({ 'CLIENTNUM': test['CLIENTNUM'], 'Attrition_Flag': pred[:,1] }) submit.to_csv('000000.csv',index=False)
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
가설검정 결과 채택/기각 선택
p-value가 0.0006이 나와서 대립가설을 채택하는게 맞을텐데 소문제 c는 답을 어떻게적어야하나요? '가설검정의 결과를' 채택,기각 중 골라야하는데 가설검정의 결과라는게 0.0006인거고 , 그럼 채택으로 답을 적어야하나요?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
예시문제 작업형3 소문제1번
1번 문제가 잘 이해가지 않습니다.분산에 차이가 있는지 알아본다 ->등분산 검정을 수행하라는 것 같아 반사적으로 levene을 떠올리고 있었는데, 'F-검정을 수행할 때 검정통계랑을 구하라'라는 지문이 이해가지 않아요 검정 통계랑이라는게 각 분산값을 나눈것으로 정의되어 있는건가요? 저렇게 나누는것이 F-검정인가요
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
기출6회 제1유형 질문
강사님 기출6회 제1유형 3번문제에서 groupby 진행해서 월별 나누기 12하는건 알겠으나,data 확인해보니 연도별로 월별 수량이다릅니다. 근데 12로 나누면 515로 반영이되는데, 애초에 data가 안맞지 않나요? 확인해주시면 감사하겠습니다. import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/6_1/data6-1-3.csv") # df.info() # df.head() df['year'] = df['날짜'].str[:4] df = df.groupby('year')['날짜'].count() df
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
기출2회 작업형2
기출 2회는 한가지 방법으로 풀기(랜덤포레스트) 가 적용이 안되나용?
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
아노바 f검정과 일원분석분석(one-way-anova)
https://www.kaggle.com/code/gggyun/t3-ttest-anova-py/edit 이 문제를 풀다가 의문이 생겨 질문드립니다. 아노바 f검정과 일원분산분석은 동의어라고 보면 될까요?
-
미해결파이썬 무료 강의 (기본편) - 6시간 뒤면 나도 개발자
가변인자의 위치가 중요한가요?
수업 듣다가 궁금증이 생겨서 질문드립니다.가변인자를 쓰면 값의 개수와 상관없이 함수가 실행되는 것 같은데 그러면 가변인자는 항상 함수에서 맨 마지막에 써야 하나요? 예를 들어 profile(name, age, *language, address) 이런식으로 함수를 구성하게 되면, 제가 profile ("유재석", 20, "파이썬", "자바", "C","서울시") 이렇게 적었을때 어디까지가 language이고 어디부터가 address 인지 모르지 않을까 해서요.
-
해결됨[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
8회기출 3유형 1번
로지스틱 모델의 포뮬라를 만들때 자료형은 수치형이지만 범주형인 데이터(ContractRenewal, DataPlan)들이 있는거 같은데 이것들은 c로 안묶어도 되는건가요?