학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 df.groupby('원두').mean() 실행시 TypeError: agg function failed [how->mean,dtype->object] 이 오류는 어떻게 해결하나요?
선생님 안녕하세요! 시험이 다가오면서 헷갈리거나 저번에도 살짝 아리쏭했던 부분이 복습하면서 이해못한 부분이 명확해지면서 질문들이 많아졌는데 항상 자세히 알려주셔서 감사합니다 ㅠㅠㅎㅎ 오늘도 질문드립니다!! 1. X_train데이터와 y_train데이터가 나누어져서 제공받았을 때 이를 합쳐야 하는 경우가 무엇인가요? 그리고 만약 합친 경우 나중에 꼭 분리를 해야하나요? 2. 작업형 2를 진행할 때 결측치가 있을 시 행은 삭제하면 안되고, 컬럼은 train, test데이터 각각에 모두 삭제는 가능한 것 맞을까요? 3. count() 함수는 axis=0일 때 컬럼을 기준으로 세는 것이 맞나요? 원래라면 axis=0이 행을 기준으로 하는 것으로 알고있는데 count()는 반대인듯 해서요! 4. 데이터 피처 엔지니어링을 진행할 때 스케일링 시 X_train[cols]는 데이터 프레임 형태로 진행되는 것 맞을까요? 그렇다면 라벨인코딩에서는 for문을 사용하여 X_train[col]로 진행하는데 그러면 데이터 프레임이 아닌 시리즈 형태인것 아닌가요?? 이 부분이 헷갈려서 여쭤봅니다! 5. 만약 작업형 2에서 범주형 데이터가 1~2개만 있다면 수치형 데이터로만 모델을 평가도 해보고 범주형을 인코딩해서 다함께 평가 두가지를 모두 해보는게 좋을까요, 아니면 범주형 데이터가 있다면 인코딩을 했을 때를 무조건 해보는 것이 좋을까요? 6. describe에서 이상치가 눈에 보인다면 행을 삭제 못하는데 어떻게 해야하나요? 아예 그 컬럼을 삭제하는게 나을까요? 7. random_state값을 달리하면 평가지표도 다르게 나오던데 아무숫자나 고정해서 쓰면될까요? 모든 것에 random_state=0 이런식으로 고정해서요! 8. n_estimators는 max_depth를 안쓰고도 써도 되나요?
from sklearn.preprocessing import LabelEncoder cols = ['Gender','Education_Level','Marital_Status','Income_Category','Card_Category'] 이렇게 하나하나 다 적는방법도 잇지만 cols= train.select _dtypes(include="O").columns 이렇게도 가능하다고 하셧는데 만약 이렇게하면 다른 네임명으로 받으면서 test도 따로 해줘야하나요 cols2= test.select _dtypes(include="O").columns 이렇게요?
코랩으로 입력중인데 from sklearn.preprocessing import LabelEncoder cols = ['Gender','Education_Level','Marital_Status','Income_Category','Card_Category'] for col in cols: le=LabelEncoder() train[col] = le.fit_transform(train[col]) test[col] = le.transform(test[col]) target = train.pop('Attrition_Flag') 에러가 나와요 왜그런거죠 KeyError Traceback (most recent call last) /usr/local/lib/python3.10/dist-packages/pandas/core/indexes/base.py in get_loc(self, key, method, tolerance) 3801 try: -> 3802 return self._engine.get_loc(casted_key) 3803 except KeyError as err: 6 frames pandas/_libs/hashtable_class_helper.pxi in pandas._libs.hashtable.PyObjectHashTable.get_item() pandas/_libs/hashtable_class_helper.pxi in pandas._libs.hashtable.PyObjectHashTable.get_item() KeyError: 'Attrition_Flag' The above exception was the direct cause of the following exception: KeyError Traceback (most recent call last) /usr/local/lib/python3.10/dist-packages/pandas/core/indexes/base.py in get_loc(self, key, method, tolerance) 3802 return self._engine.get_loc(casted_key) 3803 except KeyError as err: -> 3804 raise KeyError(key) from err 3805 except TypeError: 3806 # If we have a listlike key, check indexing_error will raise KeyError: 'Attrition_Flag'
선생님 안녕하세요~ 그간 많은 질문을 남겼는데요! ㅠㅠ 작업형1,2는 기출을 바탕으로 연습문제도 꽤나 있어서 캐글을 포함하여 강의에 있는 문제까지 풀면서 대비하고 있습니다.. 다만 작업형3은 인강에 있는 문제와 코드 공부하고 있는데, 아직까지 개념이 흩날려있다고 해야하나요.. 뭔가 딱 잡히는 게 없는데, 어떤식으로 대비하는게 좋을까요? ㅜㅜ 일단 전 완전 초보자라서 작업형2에서 만점, 작업형1에서 많아야 2개, 작업형3은 최대1개 맞추는 전략으로 갈까합니다 ㅠㅠ
https://www.kaggle.com/code/agileteam/t3-example/notebook 위와 같은 대응 표본 t-검정 문제에서, 정규성 검정을 진행하는 집단에 대해 궁금합니다. 1) shapiro(df['bp_pre']), shapiro(df['bp_post']) 각 집단에 대해서 모두 수행해야 하는지, 2) df['diff'] = df['bp_post'] - df['bp_pre'] 집단 간 차이에 대해서 정규성 검정을 수행하는지 두번째로 표본 검정 문제에서 정규성 가정을 제시하지 않았다면 모든 shapiro부터 수행해야 한다고 이해했는데, 제시해주신 풀이에는 정규성 검정을 수행하지 않고 ttest_rel로 바로 진행하셨던데, 문제의 가정에 따라서 정규성 검정을 수행해야 하는것이 아닌가요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 대응표본검정 > Shapiro-Wilk 검정 할 때, 'before' 'after' 순서를 알고 싶습니다. 구글링을 통해 무조건 아래 순서대로 작성해야 한다는 글을 보아서 질문 드립니다. stats.shapiro(df['before'] - df['after']) 강의를 통해 문제에서 주어지는 μd를 참고하여, 대응표본검정(ttest_rel)을 작성하는 것으로 이해했습니다. μd = (before – after)의 평균 stats.ttest_rel(df['before'] , df['after']) μd = (after - before)의 평균 stats.ttest_rel(df['after'], df['before']) 그렇다면 Shapiro-Wilk 검정을 할 때도 문제에서 주어지는 μd를 참고하여, 작성하면 될까요? μd = (before – after)의 평균 stats.shapiro(df['before'] - df['after']) μd = (after - before)의 평균 stats.shapiro(df['after'] - df['before'])
안녕하세요, 선생님 아직 개념이 정확히 안잡혀서 문의 하나드립니다. 작업 2유형에서 Train/Test 데이터 전처리, 피처 엔지니어링시 2개 데이터 셋 모두 진행해야되는걸로 알고있는데요. Test 데이터에서 컬럼 삭제 후 모델링해도 된다고 알고있는데, (예를들어 Unnamed: 0 이라는 index 칼럼이 있을 경우) 행 삭제는 하면 안되는 걸까요? (Test 데이터의 행 삭제를 하게 되면 모델링 이후 test 데이터 평가시 오류가 발생하는걸로 알고있습니다.) 결론적으로 전처리, 피처 엔지니어링시 절대 건들지 않아야 할 데이터 (주최 측 평가시 영향을 미치는 데이터)가 뭔지 궁금합니다.
작업형 3번 답안 제출시 하드코딩 하면 안되는건가요? 혹시 답안 제출은 어떤 형식으로 해야할지 알 수 있나요? ex) pvalue 값을 제출 해야하는 경우라면 값이 0.02인걸 확인하고 답안란에다 0.02를 적어도 무방한가요? 아니면 pvlaue 값을 나타낼수 있는 코딩을 해야하나요?