1. Section 8. 시계열 데이터, 필터링, 데이터 개수 문제 df['subscribed']= pd.to _datetime(df['subscribed']) df['y_m']=df['subscribed']. dt.to _period("m") # print(df.head()) print( df.info ()) cond1=df['y_m']=='2024-02' cond2=df['f3']='gold' df=df[cond1&cond2] 저는 이렇게 페리어드로 코딩 했는데 오류가 납니다ㅠ /tmp/ ipython-input-3254161643.py:7 : FutureWarning: 'm' is deprecated and will be removed in a future version, please use 'M' instead. df['y_m']=df['subscribed']. dt.to _period("m") --------------------------------------------------------------------------- TypeError Traceback (most recent call last) /usr/local/lib/python3.12/dist-packages/pandas/core/ops/array_ ops.py in na_logical_op(x, y, op) 361 # (xint or xbool) and (yint or bool) --> 362 result = op(x, y) 363 except TypeError: TypeError: ufunc 'bitwise_and' not supported for the input types, and the inputs could not be safely coerced to any supported types according to the casting rule ''safe'' During handling of the above exception, another exception occurred: ValueError Traceback (most recent call last) 6 frames ops.pyx in pandas._libs.ops.scalar_binop() ValueError: Buffer dtype mismatch, expected 'Python object' but got 'bool' The above exception was the direct cause of the following exception: TypeError Traceback (most recent call last) /usr/local/lib/python3.12/dist-packages/pandas/core/ops/array_ ops.py in na_logical_op(x, y, op) 383 ) as err: 384 typ = type(y).__name__ --> 385 raise TypeError( 386 f"Cannot perform '{op.__name__}' with a dtyped [{x.dtype}] array " 387 f"and scalar of type [{typ}]" TypeError: Cannot perform 'and_' with a dtyped [bool] array and scalar of type [bool] 이렇게 오류가 납니다 2. 결측치가 삭제된 데이터를 사용하여 지역별(city) 평균을 계산하시오. 이문제에서 df=df.groupby('city').mean()이렇게 하면 오류가 나던데ㅠ df = df.groupby(['city']).mean(numeric_only=True) 이렇게 뒤에 numeric 까지 반드시 해야하나요?
안녕하세요. 강의를 너무 잘 듣고 있는 학생입니다. 현재 creatomate까지 다 완강하고 youtube 자동업로드만 들으면 강의를 다 듣게됩니다. 궁금한지점이, 현재 youtube 자동화 시트에 여러 id와 title 컨텐츠들이 있는데요. 강사님이 만들어주신 n8n은 계속해서 첫 번째, id의 컨텐츠만 영상을 생성했습니다. 이것을 다른 특정 id로 바꾸거나 youtube 자동화 시트에 적혀진 모든 id의 컨텐츠를 생성하려면 n8n의 어디 부분을 고쳐야 하나요?
from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier() model = rf.fit(X_tr, y_tr) pred_proba = model.precit_proba(X_val) from sklearn.metrics import roc_auc_score ra = roc_auc_score(y_val, pred) pred_test = model.predict_proba(test) result = pd.DateFrame({'pred':pred}) result.to_csv('result.csv', index=False) 안녕하세요 2유형 공부 중 질문드립니다. 위 코드와 같이 test를 예측할때 fit 된 변수 'model'을 그대로 가져와서 model.predict_proba(test) 해도 되나요? 영상에서는 rf 변수를 사용해서 rf.predict_proba(test)로 한걸로 보여서요. 두개가 같은건가요..? 감사합니다
3번 대응 표본 검정 자료가 정규분포를 가정한다는 문구를 보지 못하고, shapiro 검정부터 해보았는데, stats.shapiro(df['기존방법']-df['새로운방법']) ShapiroResult(statistic=np.float64(0.782923502611104), pvalue=np.float64(0.008985928943897126)) 이렇게 pvalue가 0.05보다 작아서, 귀무가설 기각-> 즉 정규분포를 만족하지 않게 나오길래 wilcoxon으로 풀었는데 다 풀고 나니 정규분포를 만족한다는 문구가 있더라구요... 혹시, 실제 문제에서도 이런 경우가 있을까요? 문제 기준으로 하면 될까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 작업형2의 섹션4에서는 결측치가 있는 칼럼들이 많았어서 저는 우선 전처리로 결측치가 있는 행을 dropna(subset = ['칼럼'], axis=0)를 이용해서 결측치를 처리하는 방향으로 제거를 하였습니다. 이렇게 train과 test 데이터 모두 결측치를 제거하여, 양쪽 전부 데이터 shape에 변화를 준 상태로 학습과 예측을 진행하였습니다. 최종적으로 test의 행의 개수와 결측치 처리를 한 직후의 test 행의 개수가 일치하는 것까지 확인하였으나, 혹시 시험에서는 결측치 처리에서 발생한 기존 데이터 shape 변화로 실격처리가 될 수 있는 경우가 존재하는지 궁금합니다. 밑에 예시 정답으로는 결측치를 전부 X로 처리하시고 진행하셔서 제가 데이터 전처리를 한 방법으로 실제 시험장에서 그대로 사용할 수 있을지 질문드립니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 # 코드 실행 시 제공 패키지 리스트 확인 가능 import pkg_resources import pandas pandas.set_option('display.max_rows', None) OutputDataSet = pandas.DataFrame(sorted([(i.key, i.version) for i in pkg_resources.working_set])) print(OutputDataSet) # 파이썬 제공 패키지 수 : 63개 # updated 2025.11.07, 제11회 빅데이터분석기사 실기 버전 # Warning 메세지로 인한 실행 실패 안내는 실행 및 결과에 영향없음.(가이드 3p 참고) 위와같은 실기체험환경 안내에 나와있는 패키지 확인 코드는 실제 시험장에서는 작성이 되어있나요? 아니면 외워가야하나요?
# 시험환경 세팅 import pandas as pd from sklearn import datasets dataset = datasets.load_diabetes() df = pd.DataFrame(dataset['data'], columns=dataset['feature_names']) df.to_csv("data1-2.csv", index=False) ##################################################################### # 출력을 원할 경우 print() 함수 활용 # 예시) print(df.head()) # getcwd(), chdir() 등 작업 폴더 설정 불필요 # 파일 경로 상 내부 드라이브 경로(C: 등) 접근 불가 # 데이터 파일 읽기 예제 import pandas as pd a = pd.read_csv("data1-2.csv") # 사용자 코딩 #print(a.info()) print(a.shape) #print(a.isnull().sum()) df = a[['s1','s2','s3','s4','s5','s6']] df = df.sum(axis=1) #print(df) result = df>0.1 print(sum(result)) 이런식으로 코드를 짜서 답은 맞게 나왔는데요, 사실 [[]]두 번쓴 이유는 딱히 없기는해요 ㅠㅠ 에러가 떠서 [[]]해봤는데 된거라서.. 혹시 이렇게 구해도 되는 건지, 된다면 혹시 [[]]에 대한 설명도 같이 들을 수 있을까요?
컴퓨터 공학에 아예 문외한이기도 하고 시험 준비 기간도 짧아 최대한 문제를 풀 수 있는 정도만 준비해가려고 합니다 작업형 2번은 타겟 분리 트레인, 테스트 합쳐서 원핫인코딩 후 재분리 검증데이터 분할 랜덤포레스트(Classifier/Regressor) 적용하여 피팅 pred로 바로 테스트 데이터 예측(predict 또는 predict_proba) DataFrame 생성 후 제출 제출물 shape가 test와 맞는지 확인 이정도로 준비해가려고 합니다 어차피 한가지 타입으로 해서 낼거면 평가는 별도 안해봐도 괜찮을까요?
model = logit('gender ~ weight', data=train).fit() pred = model.predict(test) from sklearn.metrics import accuracy_score score = accuracy_score(pred, test['gender']) print(1-score) 이 코드를 실행하면 ValueError: Classification metrics can't handle a mix of continuous and binary targets 이렇게 연속된 값과 이진분류를 혼용했다는 오류가 뜨는데, model = LogisticRegression() model.fit(X_train, y_train) # 3) 테스트 데이터를 사용해 예측 pred = model.predict(X_test) # 4) 실제 값과 예측값을 사용하여 정확도 계산 acc = accuracy_score(y_test, pred) # 5) 오류율 계산 print(round(1 - acc, 3)) 강사님의 두번째 풀이 코드(위 코드)를 실행하면 아무런 문제가 없어서, 두 코드 전부 accuracy_score에 실제 값과 예측값을 넣어주었음에도 실행 결과가 차이가 나는 이유가 궁금합니다. 혹시 LogisticRegression()으로 모델을 생성하면 결과가 0,1의 이진값으로 나오고, logit()으로 모델을 생성하면 결과가 0과 1 사이의 확률값으로 나와서, 모델 생성에 logit()을 사용했다면 accuracy score를 구해야 하는 경우 확률값이 0.5보다 큰지 작은지를 구분하는 후처리를 해줘야 하는 것인 걸까요? 감사합니다.