학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요! set 방법이 이제 생각나서 다시 돌아와서 보고 있습니다. set으로 확인하는 과정은 EDA에서 해주는게 맞죠? a = set(train['object컬럼명'].unique()) b = set(test['object컬럼명'].unique()) 이렇게 정의 해주었을때 test에 있는데 train에 없는 경우만 예외경우로 합쳐서 레이블 인코딩 해줘야하니 print(b-a) 만 해주면 되는거 맞죠? (굳이 a-b는 안해줘도되나 싶어서요) 이 값이 어떤 값이 나오면 합쳐서 레이블 인코딩 해주고 분리해주는거구요! 만약 합친 다음에 레이블 인코딩 해줘야한다면 <전처리 단계> target = train.pop('타겟컬럼') from sklearn.preprocessing import LabelEncoder cols = train.select_dtypes(include='object').columns df = pd.concat([train,test]) for col in cols: le = LabelEncoder() df[col] = le.fit_transform(df[col]) train = df.iloc[:len(train)] test = df.iloc[len(train):] 이 순서대로 진행하면될까요? 마지막으로 합쳐서 레이블 인코딩 할때 object 컬럼이 여러개 있다면 (예를들어 6개가 object 컬럼이라면) 6개중 단 하나의 object 컬럼이라도 print(b-a) 했을때 값이 나온다면 합쳐서 레이블 인코딩 후 분리해주는거 맞죠?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 f1_score에서 숫자면 그대로 문자면 f1_score(실제값, 예측값, pos_label='1인값') 이라고 일전에 강의에서 설명해주셨는데요 여기서 말하는 문자, 숫자는 target 컬럼의 info를 보고 판단하는거 맞나요? 1인값에는 1인 카테고리 명을 쓰면 되는지 여쭤봅니다.
1) /n 'roc_auc:', roc_auc (roc_auc는 변수명) 이렇게 입력하던데 저기 / 슬러시는 반대로 작성하는 거 어찌하는건가요? 키보드에 어떤값을 눌러서 작성하신걸까요? gpt 에서는 shift 와 / 를 누르면 된다는데 전 ? 가 출력되거든요ㅜ 1-1) roc_auc: 뒤에 ':' 표시는 붙은 이유가 모든 값을 포함한다는 건지두요,, 2) 그리고 또하나는 f1 score나 roc 와 같은 점수 표시할때는 저렇게 코드 작성을 하던데 어떤 의미인지 궁금합니다. pd.DataFrame({'pred':pred)} 처럼 /n roc_auc: 를 지정한 roc_auc 변수명으로 대입한다는 뜻일까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 실제 시험 환경으로 실습 진행 중인데, 궁금한게 있어요 실제 시험에서 복사/붙여넣기가 불가능한가요? 예를 들어서 제가 작성한 코드를 복사해서 다른 코드에 또 활용한다던가 print문으로 나온 숫자를 복사해서 붙여넣는다거나 연습중에는 복사/붙여넣기가 안되더라구요 정답을 제출한 뒤 맞게 제출 했는지 확인을 위해 다시 풀이로 돌아갔는데 코드가 모두 지워져있었습니다. (풀이 > 정답제출 > 풀이) 실제 시험 중에도 이런 식으로 항목 이동을 하면 풀이 과정에서 진행했던 코드들이나 print문으로 추출한 숫자들이 삭제되는지 궁금합니다!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선생님 작업형 2 유형 datetime 컬럼 관련해서 올려주신 글을 보고 1. datetime: 라벨인코더 진행 2. datetime: 드랍했을 때 3. datetime: datetime 변환 해서 점수를 내보았는데요. label encoder의 성능이 제일 좋았습니다. 혹시 label encoder로 모델을 검증한 것은 너무 과적합 된 값일까요? 과적합 되어있다면 datetime이 나올 경우 변환하는 것이 가장 좋은 방법일까요?
안녕하세요! 작업형 2번 관련해서 질문 드려도 괜찮을까요…? 혹시 get dummies 하기 전에 데이터 합치고 나눠야만 하나요..? 수치형 데이터로 구성되어있고, 컬럼 같을 경우에는 합치고 나누는 작업 없이 get dummies 진행했는데 다른 풀이하고 결과값이 조금 차이 나는 것 같아서요! Get dummies 전후로 데이터 합치고 나누는 이유를 알고 싶습니다! 제 코드 # print(train.shape, test.shape) train = pd.get_dummies(train) test = pd.get_dummies(test) # print(train.shape, test.shape) 다른 분들 모범 코드입니다¡ data = pd.concat([train,test]) data = pd.get_dummies(data) train = data.iloc[:len(train)] test = data.iloc[len(train):]
검증 데이터 분할을 해서 일반적으로 모델에 rf.fit (X_tr_y_tr)을 진행하고 예측하다가 마지막에 바로 pred =rf.predict(test)로 테스트 데이터를 집어 넣는데요, rf.fit (train,target) 으로 다시 학습하고 집어 넣지 않아도 상관이 없나요 ? 두개가 굳이 차이가 없기떄문에 분할로 생성된 모델을 넣는건지 이유가 있는건지 궁금합니다
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 영상 잘 보고 있습니다. 다름이 아니라 ols나 logit 후 summary로 나왔을 때, 답을 이걸 적으면 된다. 라고 하시면서 그냥 숫자를 적어주시던데. 그래도 되나요? 예) summary 값으로 p_value값이 가장 높은것은? 나왔을때, 따로 model.pvalues.max() 이런방식으로 맥스값을 불러오는게 아니라, 그냥 보고 아 이게 가장 크다 해서 큰 값을 손으로 적어도 되나요? model이후 이름?들 외우기도 힘들어서요 ㅠ 된다고 하면 그 값들은 안외워도 되니까요
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선생님 작업형2유형의 경우 데이터가 train,test(2개)로 주거나 X_train, X_test, y_train으로 주는 경우가 있는데 제가 이해한 방향이 맞는지 확인해주시면 감사합니다. #2개일 경우(train, test) train 데이터에서 id 분리or 드랍, 타겟값 분리 test 데이터에서 id 분리 or 드랍 train값과 타겟값으로 검증 test 값으로 학습 #3개일 경우(X_train, X_test, y_train) X_train 데이터와 y_train 값(타겟 값)으로 검증, X_test 데이터로 학습 후 제출