안녕하세요. 질문이 있습니다. object 컬럼 'neighbourhood'에 대해서... object 형 컬럼의 고유항목들이 train 데이터와 test 데이터 모두 일치하는지 확인한 후 일치하지 않으면 train 데이터와 test 데이터를 concat으로 합친 후에 인코딩을 진행하고 다시 분리해주라고 학습했습니다. 그런데 이번 수업 에어비엔비 자료에서 'neighbourhood' 항목이 일치하지 않는 것으로 확인되어 concat 과정을 진행해 주었는데 수업에서는 이 과정이 없더라구요. 관련 질문을 찾아보니 test 데이터의 항목을 train 데이터가 모두 포함하고 있으면 레이블 인코딩은 가능하고 원핫 인코딩은 불가능하다고 하신 것 같은데 이렇게 생각하니 너무 복잡한 것 같아서요. 그냥 일치하지 않는 항목이 있으면 무조건 concat을 진행해준다고 생각하면 오히려 편할 것 같은데 이렇게 생각하고 문제를 풀어도 오류가 없을지 궁금합니다. 그리고 저는 'neighbourhood' 항목이 object형이고 value가 200개 이상으로 꽤 크다고 생각했으며 price를 예측할 때 크게 의미 있는 컬럼이라는 생각이 들지 않아서 굳이 인코딩하기 보다는 과감하게 삭제를 진행했었는데요. 문제를 풀 때 이렇게 자신의 기준으로 컬럼을 삭제해도 괜찮은 건가요? csv 파일로 생성해야 하는 target 컬럼 같은 경우 어쩔 때는 데이터 전처리 초반에 다음과 같은 코드(target = train.pop('price'))로 미리 분리를 해두거나 이번 수업처럼 검증 데이터를 분리할 때 X_train, X_val, y_train, y_val = train_test_split(train.drop('price', axis=1), train['price'], test_size=0.15, random_state=2022) 이런 식으로 함수 매개변수로 설정해주시기도 하셨잖아요. 방법이 여러 가지가 있어서 그때그때 다른 방법을 보여주신 거라고 생각하면 될까요? 그리고 test_size를 보통 20%로 잡으시던데 이번엔 15%로 잡은 이유가 별도로 있으신 건지 궁금합니다. 만약 전처리 할 때 target = train.pop('price')을 통해 미리 타겟을 분리해두면, train 데이터에 타겟 컬럼이 존재하지 않게 되잖아요. 근데 검증 데이터 분리할 때 첫 번째 매개변수로 train 데이터를 두 번째 매개변수로 타겟 값을 넣어줌으로써 학습 및 검증은 타겟값이 정상적으로 활용되는 것이 맞나요? 이 가정이 맞다면 문제가 없지만, 가정이 틀리다면 저 타겟을 왜 분리하는지 이해가 되지 않을 것 같습니다..
1.머신러닝 인코딩 강의 관련하여 원핫 인코딩 또는 라벨 인코딩 둘 중 하나를 사용하면 된다고 하는데, train_oh = pd.get_dummies(train) test_oh = pd.get_dummies(test) data = pd.concat([train, test], axis=0) data_oh = pd.get_dummies(data) train_oh = data_oh.iloc[:len(train)].copy() test_oh = data_oh.iloc[len(train):].copy() 해당 원핫 인코딩만 적용하면 ValueError: could not convert string to float: 'Private' 해당 오류가 뜨면서 cols = ['workclass', 'education', 'marital.status', 'occupation', 'relationship', 'race', 'sex','native.country'] from sklearn.preprocessing import LabelEncoder for col in cols: le = LabelEncoder() train[col] = le.fit_transform(train[col]) test[col] = le.transform(test[col]) 라벨 인코딩까지 같이 적용해야 오류가 안 뜨는데, 혹시 두 가지 같이 적용해야 되는지 문의드립니다. 또한, 머신러닝 (회귀) 강의에서는 인코딩 하는 방법이 cols = ['Item_Identifier', 'Item_Fat_Content', 'Item_Type', 'Outlet_Identifier', 'Outlet_Size', 'Outlet_Location_Type', 'Outlet_Type'] df = pd.concat([train, test]) # 라벨 인코딩 from sklearn.preprocessing import LabelEncoder le = LabelEncoder() for col in cols: df[col] = le.fit_transform(df[col]) # 원핫 인코딩 df = df.drop('Item_Identifier', axis=1) df = pd.get_dummies(df) train, test 개별로 보지않고, 합쳐서 적용을 하는데 별도로 분리해서 적용하지 않고 한번에 합쳐서 적용해도 되는지 궁금합니다! 인코딩 부분이 헷갈리는데, 가장 보편적으로 사용되는 인코딩 방법이 어떤것인지 알려주시면 해당 방법으로 주로 학습해보겠습니다!^^
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 작업형 모의문제1번부터... data:members.csv 를 사용해서 문제를 풀게 되어 있는데 코드에 이렇게 링크로 적혀있는데 어떻게 불러오나요?? import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv")
pyenv virtualenv 3.11.8 goodpang 하니까 no such command 'virtualenv' 라고 뜨고 구글 검색해보니까 인프런 q&a 에서 윈도우에서는 잘 동작하지 않는다고 되어 있습니다. 인프런 AI가 아래를 추천해주는군요. python -m venv myenv
graphql 포트폴리오용 주소는 접속이 되지만 graphql practice 주소와 rest-api practice 주소가 접속이 안되는 것 같습니다. http://practice.codebootcamp.co.kr/graphql http://practice.codebootcamp.co.kr/api-docs 해당 주소로 접속하였을 때 사이트에 연결할 수 없다고 나옵니다.
flutter도 써봤고, react/next도 다 쓰고 있는데요... expo의 라우팅 구조가 진짜 번잡하고 혼란스럽다고 느껴지네요. 혹시 현업에서도 알려주신 라우팅 방법(group 폴더, index.tsx, layout.tsx 등 활용)이 최선인가요? 뭐랄까.. 이상한 스킬들로 겨우겨우 원하는 결과물을 만들어내는 느낌이에요 ㅠㅠ