캐글 3유형 문제 푸는중입니다. stats.ttest_rel(df['bp_pre'], df['bp_post'], alternative='greater') stats.ttest_rel(df['bp_post'], df['bp_pre'], alternative="less") 두 코드의 결과 중 통계량은 왜 다를까요? 하나는 양수 하나는 음수입니다. 적은 것 보고 적다고하고, 큰 것을 크다고 하면 결과가 같다고 들었던 것 같은데 잘못 알고있는걸까요?
안녕하세요. 오브젝트가 대부분인 데이터인데, 오브젝트를 드랍한 게 인코딩 했을 때보다 점수가 더 좋게 나오는 경우.. 그냥 드랍해서 모델 학습시켜도 되는 걸까요? 전에 다른 회차에서도 하나만 수치형 데이터인데 그 수치형 데이터만으로 예측한 게 점수가 더 좋게 나왔었어요..!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선생님, 지금까지 코랩이나 주피터에서 연습할때는 프린트 없이 출력하면 데이터테이블 형태로 나와서 보기 편했는데, 체험환경은 프린트를 무조건 넣으면 시리즈로 나와서 보기 불편한데, 이걸 데이터프레임형식으로 보는 방법이 있나요...? ㅠㅠ
안녕하세요 책과 강의 구매후 공부중입니다. 책에 챕터3에 연습문제가 있는데요, 해당 문제는 강사님의 깃허브에서 파일이 있더라구요. 그리고 캐글에도 다른 연습문제가 있는거 같은데.. 두 곳에서 문제를 다 풀면 좋지만, 시간 여건상 하나만 선택해야 한다고 했을때, 어느 문제를 풀어보는게 좋을까요?
예시문제 작업형 2를 풀다 생긴 질문인데요. train_test_split함수에 들어있는 random_state값이 바뀔때 마다 평가지표의 값이 눈에 띄게 달라지는데 정상인가요? 0일땐 800초반대, 1일땐 1100중반대가 나오는데, 이정도면 꽤나 차이가 나는게 아닌지요? +시험 현장에선 random_state 값을 두세개 넣어보는게 좋을까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 p-value 값을 구할때, 반올림하거나 정수를 구하라 이런말 없으면 그냥 카이제곱검정했을 때 나온 소숫점 자리수 전부 다 입력해야하나요? 하나라도 빠지면 틀리는걸까요? 자리수 명시가 명확하지않는경우도 있나요?
안녕하세요. 수강중 문의드립니다 전처리 파트 중 인코딩 부분에서, 인코딩 했을 때 칼럼수가 너무 많아질 경우 원핫 말고 라벨인코더를 사용하는데요 시험장 컴퓨팅 환경을 기준으로 컬럼이 몇개 오버될경우 라벨인코더를 사용하면 좋을지 에대해 기준점을 제시해주시면 감사하겠습니다.(현재 200개 언더로는 원핫 쓰고 그이상은 라벨인코더 쓰는 식으로 하고있습니다)
train과 test 데이터 전처리 시, 두 데이터 모두에서 '총구매액' 과 '최대구매액'이 음수이길래 이상치인줄 알고 전처리에 고민을 좀 했습니다. 고민하다보니 전액 환불한 경우에는 논리적으로 음수가 맞더라고요. 그래서 별도의 이상치 처리는 안 했습니다. 다만, 제가 궁금한점은 실제 시험에서 이상치가 나왔을 때 대응 방법 (예를 들어, 이상치가 아닌 데이터만 살리는 등) 이 문제처럼 test데이터에서 이상치가 나올 가능성이 있는지와 대응방법 (test데이터의 행은 삭제해서는 안 되는 것으로 알고 있습니다.) 위 두가지가 궁금합니다.
ValueError Traceback (most recent call last) /usr/local/lib/python3.11/dist-packages/pandas/core/indexes/range.py in get_loc(self, key) 412 try: --> 413 return self._range.index(new_key) 414 except ValueError as err: ValueError: 3 is not in range The above exception was the direct cause of the following exception: KeyError Traceback (most recent call last) 3 frames /usr/local/lib/python3.11/dist-packages/pandas/core/indexes/range.py in get_loc(self, key) 413 return self._range.index(new_key) 414 except ValueError as err: --> 415 raise KeyError(key) from err 416 if isinstance(key, Hashable): 417 raise KeyError(key) KeyError: 3 기출3회 작업형1 3번 문제를 풀 때, 맨 처음 데이터를 다시 실행시켜주지 않으면 동일한 코드라도 이런 오류가 뜹니다. 매번 처음 데이터를 실행해줘야하나요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 방법 2인 pivot table을 만든 이후에 기존 방법 1의 grouped['차이'] 항목을 만들어 처리하였는데요. 방법 2에서는 grouped라는 변수에 pivot table 결과를 안넣으셨는데, pivot table 결과가 어떻게 grouped에 들어간걸까요??