안녕하세요 강사님! 좋은 강의에 감사드립니다. 다름이 아니라, 3회 기출문제(작업형2)에서 아래와 같이 robust scaler를 사용하실 때 train과 test를 각각 스케일링하는 거랑 data = pd.concat[train, test]로 합치는 것과 실전에서 영향이 없을까요? train 범위 표본을 가지고 fit 한 경우와 concat한 큰 data를 가지고 fit 한 경우가 스케일링 결과가 다른 경우가 있을까요? n_train[cols] = scaler.fit_transform(n_train[cols]) n_test[cols] = scaler.transform(n_test[cols])
4회 기출 작업형2에서 해설처럼 # test데이터 ID 복사 test_ID = test.pop('ID') test_ID test_ID를 따로 분리하지 않고 아래처럼 test['ID'] 이렇게 작성해도 같은 결과값이 나올까요? pred = model.predict(test) result = pd.DataFrame({'ID' : test['ID'] , 'Segmentation' : pred }) result.to_csv('result.csv', index = False) print(pd.read_csv('result.csv'))
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 작업형2번 문제 전처리 부분을 원핫인코딩한다면 어떤 코딩으로 써야하나요? 답변부탁드립니다. 원핫으로만 하려고하는데 다양하게 알려주셔서 더 헷갈려서요..
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 cond1 = df['구분'] = '발생건수' cond2 = df['구분'] = '검거건수' df1 = df[cond1] df2 = df[cond2] df2 이렇게 입력했는데 --------------------------------------------------------------------------- KeyError Traceback (most recent call last) /usr/local/lib/python3.12/dist-packages/pandas/core/indexes/base.py in get_loc(self, key) 3804 try: -> 3805 return self._engine.get_loc(casted_key) 3806 except KeyError as err: index.pyx in pandas._libs.index.IndexEngine.get_loc() index.pyx in pandas._libs.index.IndexEngine.get_loc() pandas/_libs/hashtable_class_helper.pxi in pandas._libs.hashtable.PyObjectHashTable.get_item() pandas/_libs/hashtable_class_helper.pxi in pandas._libs.hashtable.PyObjectHashTable.get_item() KeyError: '발생건수' The above exception was the direct cause of the following exception: KeyError Traceback (most recent call last) 2 frames /usr/local/lib/python3.12/dist-packages/pandas/core/indexes/base.py in get_loc(self, key) 3810 ): 3811 raise InvalidIndexError(key) -> 3812 raise KeyError(key) from err 3813 except TypeError: 3814 # If we have a listlike key, _check_indexing_error will raise KeyError: '발생건수' 왜 발생건수에 대한 오류가 뜨는거죠? 정말 샅샅히 오류를 찾아봤는데 선생님이 하신거랑 똑같이한거같은데 ㅠㅠ
선생님 안녕하세요. 여러 모델을 외우기 힘들면 랜덤포레스트 하나로 가도 된다고 말씀해주셨는데, 그렇게하면 평가(RMSE, ...)를 하는게 의미가 없다고 생각하는데요. 평가자체를 하지 않고 랜덤포레스트 모델로 학습시켜 바로 예측하여 제출해도 문제가 없는걸까요? 그리고, 연습문제 저 혼자 풀어보고 선생님 파일이랑 대략 비교해보고싶은데, 어떻게 비교 또는 확인해볼 수 있을까요?
초기 클러스터 생성시 CoreDNS 와 kube-proxy 추가가 안되는데 생성할때 제가 놓친부분이 있나하여 문의드립니다. 쿠버네티스 버전은 현재 1.34인데 강의와 같이 1.32로 낮춰서 생성했는데 어디서 잘못된건가 싶습니다. POD에서 Service로 통신 확인하는 과정에서 오류가 발생하여 gpt에 물어보니 해당 기능이 생성되지 않아서 나타나는 문제라고 하는데~ 현재는 노드그룹과 클러스터는 삭제해놓고 다시 생성하려고 하는데 어떤것을 확인하면서 생성하면 좋을까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 해당 영상 11분30초에 클라이언트 넘버를 지우는게 이해가 잘안가는데요. 나중에 타겟인 Attrition_Flag는 지우고 비교하는 이유를 알겠지만 CLIENTNUM 얘는 왜 드랍하나요? 그냥 암기로 CLIENTNUM,Attrition_Flag 788544108,0.633 719356008,0.123 712142733,0.355 이런 제출형식에서 타켓이 아닌 그 외에 것은 학습에 도움이 안되니 드랍한다. 라고 외워도 될까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 1회문제에서는 오브젝트인 컬럼들만 모아서 드랍하는건 이해가 됐는데 강의에서 그냥 데이터가 많다고 해당 열을 삭제하는건가요? 삭제하는이유가 명확하게 제가 이해를 못해서 알려주시면 감사하겠습니다 cols = ['name', 'host_name', 'last_review', 'host_id'] print(train.shape) train = train.drop(cols, axis=1) test = test.drop(cols, axis=1) print(train.shape)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 해당문제에서 ROC-AUC, 정확도(Accuracy), F1, 정밀도(Precision), 재현율(Recall)을 구하시오 라고 나와있는데 선생님 노트북을 보면 결국마지막엔 predict_proba로 roc_auc에 대한 평과결과만 실제 테스트 예측한거 아닌가요? 아직 실기가 어려운 왕초보입니다 ㅠㅠ
데이터 분리 단계의 random_state 값을 10, 50, 100, 200, 2022 등등 여러바꾸어보았는데 r2값의 편차가 큽니다. 심하면 음수값도 나오고, 높아봐야 0.3정도 수준까지 나와요. (제공해주신 코드 그대로 쓰면 0.3에 근접하게 나오나, random_state값만 바꿔도 전반적으로 떨어집니다) 내가 뭘 잘못했나 하면서.. 혼자서 몇 시간 동안 전처리 단계에서 nunique 수가 많은 object 컬럼을 추가적으로 제거해도 마찬가지고 인코딩 단계에서 one-hot과 label을 바꾸어가며 써봐도 마찬가지고 모델학습 단계에서 하이퍼파라미터값을 조정해봐도 마찬가지입니다... gpt로도 요리조리 돌려봤는데 애초에 데이터의 질 자체가 나쁘면(편차가 큰 경우 등) 코드를 아무리 수정해봐야 평가값 결과가 불안정하게 나온다고 하는데 제가 뭘 잘못하고 있는건지, 해당 문제의 데이터에 문제가 있는건지 궁금해요. 그리고 이런 경우 실전에서도 이대로 풀이를 하고 제출해도 문제가 없을까요? randomstate 값만 바꿔가다가 train 데이터에서 결과 좋은 걸 찾아 끼워 맞춰봤자, test 데이터에서는 또 전혀 다른 결과가 나올 것 같아서요 (코드를 제가 잘못짰나 싶어서 공유된 코드 그대로 써도 마찬가지입니다.. random_state값 조금만 바꿔도 평가결과값이 크게 떨어짐)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 레이블인코딩말고 원핫인코딩으로만 통일해서 하려고 하는데 코드좀 알 수 있을까요 df = pd.concat([X_train, X_test]) df = pd.get_dummies(df) X_train = df.iloc[:len(X_train)] X_test = df.iloc[len(X_train):] print((X_train.shape, X_test.shape)) 이렇게 하면 될까요