안녕하세요. 데이터 전처리 단계에서 target = train.pop('target') 타겟 처리하는 방법과 검증 데이터 분리 단계에서 이렇게 하는 방법 중에 어떤방법을 선택하던 결과에 영향이 없나요? 그리고 데이터 전처리 시에 target분리할 경우에 target 데이터가 수치형이나 범주형 상관 없이 데이터 전처리 전에 분리하면 되는건지요?
강의에 알려주신대로 따라서 하고 있는데 원핫인코딩 결과에 income category랑 card category만 뜨고 나머지 object컬럼(gender 등)은 뜨질 않습니다.. 뭐가 문제인지 알려주실 수 있을까요? #baseline(object컬럼 제거) cols = train.select_dtypes(include='object').columns # print(train.shape, test.shape) # train = train.drop(cols, axis=1) # test = test.drop(cols,axis=1) # print(train.shape, test.shape) # 라벨인코딩 # from sklearn.preprocessing import LabelEncoder # for col in cols: # le = LabelEncoder() # train[col] = le.fit_transform(train[col]) # test[col] = le.transform(test[col]) # train.head() # onehot 인코딩 pd.get_dummies(train, columns=cols) 마지막에 8101 rows × 39 columns 라고 뜨는데 그냥 표시만 안 된건가요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 소수점 나이를 제거할 때 cond = df['age'] == round(df['age'],0) 이 코드로 반올림한 값과 age가 같은 것을 조건으로 걸었는데요 소수점 자리0.5미만인 애들은 제거가 안되지 않았을가요? 예시:32 와 32.3 반올림한 값을 비교해도 같다고 나옴
csv 파일을 주어졌으니, import pandas as pd df= pd.read _csv 여기까지는 뜻도 모르고 기계적으로 따라하기는 했습니다. print(df) 한 셀만 이용하라고 하셔서 내용도 궁금하니 확인할 겸 print문을 썼습니다. . f1 컬럼의 결측치를 중앙값으로 대체 df.isnull().sum() 을 통해 df에 결측치가 있다는 사실을 이해했는데, df['f1']=df['f1'].fillna() 와 같은 형태로 채우기는 해야하는데.. 중앙값 (median 맞나요??) 코딩을 어떻게 응용해야 할 지 모르겠습니다. . 나머지 결측치가 있는 데이터(행) 모두 제거 . 앞에서부터 70% 데이터 중 view 컬럼의 3사분위수에서 1사분위수를 뺀 값 계산 궁극적으로 첫번째 문제 때 부터 문제를 읽다가 난독(?) 증상이 와서 어떤 코딩을 어떻게 적용 또는 응용해야 할 지를 몰라서 도무지 갈피가 잡히지 않습니다. 비슷한 고민이나 어려움을 겪어보셨던 분들 조언해주시면 좋겠습니다. 필기합격 유효기간도 얼마 남지 않아서 실기를 꼭 따고싶어서 인터넷 동영상 강의를 들으며 따라해볼 때는 자신감이 붙는 것 같은데, 막상 모의문제 코딩 풀이를 하려니 마음만 앞서고 몸은 전혀 따라주지 않네요... 그냥 처음 몇 번은 고민해봤자 생각이 안되니 코딩 방법이라도 외우든 요령을 틔워야만 할 수 밖에 없는지.. 정말로 갈피가 잡히지 않습니다. 문제 읽고 이해를 못해서.. 문제를 읽고 적합한 코딩을 어떻게 응용해야 할 지 몰라 실기 0점만 주구장창 받으면 스트레스만 쌓이지 않겠습니까?
아래와 같이, 수업에서 나온 코드 동일하게 작성했습니다. # 원핫 인코딩 n_train, n_test, c_train, c_test = get_nc_data() # 데이터 새로 불러오기 display(c_train.head()) c_train=pd.get_dummies(c_train[cols]) c_test=pd.get_dummies(c_test[cols]) display(c_train.head()) 그러나 원핫 인코딩에서 강의처럼 코드 표출이 안 됩니다. -> true , false로 표출됩니다. 또한, 컬럼 수도 99개로 1개 모자랍니다. 무엇이 오류일까요..?