안녕하세요. 질문이 있습니다. object 컬럼 'neighbourhood'에 대해서... object 형 컬럼의 고유항목들이 train 데이터와 test 데이터 모두 일치하는지 확인한 후 일치하지 않으면 train 데이터와 test 데이터를 concat으로 합친 후에 인코딩을 진행하고 다시 분리해주라고 학습했습니다. 그런데 이번 수업 에어비엔비 자료에서 'neighbourhood' 항목이 일치하지 않는 것으로 확인되어 concat 과정을 진행해 주었는데 수업에서는 이 과정이 없더라구요. 관련 질문을 찾아보니 test 데이터의 항목을 train 데이터가 모두 포함하고 있으면 레이블 인코딩은 가능하고 원핫 인코딩은 불가능하다고 하신 것 같은데 이렇게 생각하니 너무 복잡한 것 같아서요. 그냥 일치하지 않는 항목이 있으면 무조건 concat을 진행해준다고 생각하면 오히려 편할 것 같은데 이렇게 생각하고 문제를 풀어도 오류가 없을지 궁금합니다. 그리고 저는 'neighbourhood' 항목이 object형이고 value가 200개 이상으로 꽤 크다고 생각했으며 price를 예측할 때 크게 의미 있는 컬럼이라는 생각이 들지 않아서 굳이 인코딩하기 보다는 과감하게 삭제를 진행했었는데요. 문제를 풀 때 이렇게 자신의 기준으로 컬럼을 삭제해도 괜찮은 건가요? csv 파일로 생성해야 하는 target 컬럼 같은 경우 어쩔 때는 데이터 전처리 초반에 다음과 같은 코드(target = train.pop('price'))로 미리 분리를 해두거나 이번 수업처럼 검증 데이터를 분리할 때 X_train, X_val, y_train, y_val = train_test_split(train.drop('price', axis=1), train['price'], test_size=0.15, random_state=2022) 이런 식으로 함수 매개변수로 설정해주시기도 하셨잖아요. 방법이 여러 가지가 있어서 그때그때 다른 방법을 보여주신 거라고 생각하면 될까요? 그리고 test_size를 보통 20%로 잡으시던데 이번엔 15%로 잡은 이유가 별도로 있으신 건지 궁금합니다. 만약 전처리 할 때 target = train.pop('price')을 통해 미리 타겟을 분리해두면, train 데이터에 타겟 컬럼이 존재하지 않게 되잖아요. 근데 검증 데이터 분리할 때 첫 번째 매개변수로 train 데이터를 두 번째 매개변수로 타겟 값을 넣어줌으로써 학습 및 검증은 타겟값이 정상적으로 활용되는 것이 맞나요? 이 가정이 맞다면 문제가 없지만, 가정이 틀리다면 저 타겟을 왜 분리하는지 이해가 되지 않을 것 같습니다..
1.머신러닝 인코딩 강의 관련하여 원핫 인코딩 또는 라벨 인코딩 둘 중 하나를 사용하면 된다고 하는데, train_oh = pd.get_dummies(train) test_oh = pd.get_dummies(test) data = pd.concat([train, test], axis=0) data_oh = pd.get_dummies(data) train_oh = data_oh.iloc[:len(train)].copy() test_oh = data_oh.iloc[len(train):].copy() 해당 원핫 인코딩만 적용하면 ValueError: could not convert string to float: 'Private' 해당 오류가 뜨면서 cols = ['workclass', 'education', 'marital.status', 'occupation', 'relationship', 'race', 'sex','native.country'] from sklearn.preprocessing import LabelEncoder for col in cols: le = LabelEncoder() train[col] = le.fit_transform(train[col]) test[col] = le.transform(test[col]) 라벨 인코딩까지 같이 적용해야 오류가 안 뜨는데, 혹시 두 가지 같이 적용해야 되는지 문의드립니다. 또한, 머신러닝 (회귀) 강의에서는 인코딩 하는 방법이 cols = ['Item_Identifier', 'Item_Fat_Content', 'Item_Type', 'Outlet_Identifier', 'Outlet_Size', 'Outlet_Location_Type', 'Outlet_Type'] df = pd.concat([train, test]) # 라벨 인코딩 from sklearn.preprocessing import LabelEncoder le = LabelEncoder() for col in cols: df[col] = le.fit_transform(df[col]) # 원핫 인코딩 df = df.drop('Item_Identifier', axis=1) df = pd.get_dummies(df) train, test 개별로 보지않고, 합쳐서 적용을 하는데 별도로 분리해서 적용하지 않고 한번에 합쳐서 적용해도 되는지 궁금합니다! 인코딩 부분이 헷갈리는데, 가장 보편적으로 사용되는 인코딩 방법이 어떤것인지 알려주시면 해당 방법으로 주로 학습해보겠습니다!^^
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 작업형 모의문제1번부터... data:members.csv 를 사용해서 문제를 풀게 되어 있는데 코드에 이렇게 링크로 적혀있는데 어떻게 불러오나요?? import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv")
pyenv virtualenv 3.11.8 goodpang 하니까 no such command 'virtualenv' 라고 뜨고 구글 검색해보니까 인프런 q&a 에서 윈도우에서는 잘 동작하지 않는다고 되어 있습니다. 인프런 AI가 아래를 추천해주는군요. python -m venv myenv
안녕하세요. 아래는 강의 자료 캡처입니다. 1, 2, 3, 4 번에 대한 각각의 강의가 없어서 문의 드립니다. 특히, 4번은.. OAuth 2.0 강좌 전체에서 Authorization server 에 직접 DB 나 Nosql 에 연동하는 강의가 없는 것 같아서 꼭 보고 싶은데.. 깃헙에 브랜치마저도 없는 것 같아 문의 드립니다.. 감사합니다.
안녕하세요! 우선 강의 너무 잘 듣고 있습니다! 강의 자료에서 좋아요 수 설계 부분에서 11:17 1:1 관계이지만, 테이블 비정규화의 필요성을 살펴본 것이다. 이 부분은 1:1 관계이므로 비정규화의 필요성이 있지만, 레코드 락으로 인한 자원 한계를 고려하여 '정규화'의 필요성을 살펴본 것 이 맞지 않나 싶습니다! 혹시 제가 잘못 이해한 부분이 있다면 알려주시면 감사하겠습니다!
이 기본 구현에서 호출하는 getResultList() 는 전체 데이터를 메모리에 한 번에 로딩하므로 실제 스트리밍이 아니며 따라서 타 JPA 구현체 사용 시 주의가 필요하다. 라고 하셨는데 JpaCursorItemReader를 이용하면 모든 데이터를 메모리로 가져오기 때문에 OutOfMemoryError가 날 수 있나요?? 추가로 실무에서는 쿼리가 복잡할텐데 JPA 보단 JDBC를 사용하는 편인가요???
[질문 템플릿] 1. 강의 내용과 관련된 질문인가요? (예) 2. 인프런의 질문 게시판과 자주 하는 질문에 없는 내용인가요? (예/아니오) 3. 질문 잘하기 메뉴얼을 읽어보셨나요? (예) [질문 내용] 강의만 들었을때 JPA Cretieria와 QueryDSL 둘다 JPQL빌더 역할 하는것 같은데 자세한 차이 궁금합니다.
학습하는 분들께 도움이 되고, 더 좋은 답변을 드릴 수 있도록 질문전에 다음을 꼭 확인해주세요. [질문 템플릿] 1. 강의 내용과 관련된 질문인가요? (예) 2. 인프런의 질문 게시판과 자주 하는 질문에 없는 내용인가요? (예) 3. 질문 잘하기 메뉴얼을 읽어보셨나요? (예) [질문 내용] Hibernate: create sequence Member_SEQ start with 1 increment by 50 Hibernate: create table ADDRESS ( MEMBER_ID bigint not null, city varchar(255), zipcode varchar(255) ) Hibernate: create table FAVORITE_FOOD ( MEMBER_ID bigint not null, FOOD_NAME varchar(255) ) Hibernate: create table Member ( MEMBER_ID bigint not null, USERNAME varchar(255), city varchar(255), zipcode varchar(255), primary key (MEMBER_ID) ) Hibernate: alter table if exists ADDRESS add constraint FKsuulxb5rmrxvb83yr43ox86wn foreign key (MEMBER_ID) references Member Hibernate: alter table if exists FAVORITE_FOOD add constraint FKjchfnr69biisfgjdpoe82rpa4 foreign key (MEMBER_ID) references Member 위 그림에서 FAVORITE_FOOD 테이블에서 FOOD_NAME, ADDRESS 테이블에서 CITY, ZIPCODE 가 왜 PK가 되는지 궁금합니다.