# age 컬럼 평균값으로 채우기 value = int(X_train['age'].mean()) print("채울 값:", value) X_train['age'] = X_train['age'].fillna(value) X_test['age'] = X_test['age'].fillna(value) 강의에서는 value 함수와 print 사용해서 평균값 채우셨는데 X_train['age'] = X_train['age'].fillna(X_train['age'].mean()) X_train.isnull().sum() 이렇게 간단하게 채우고 isnull().sum()으로 결측치가 0인지 확인하는 방법도 괜찮나요? value랑 print 부분이 이해하기 어렵고 실제로 적용하기도 어려울 것 같아서요 ㅜㅜ!!
영상에서 X_train 데이터 결측치 처리 하실 때 X_train['workclass'] = X_train['workclass'].fillna(X_train['workclass'].mode()[0]) X_train['native.country'] = X_train['native.country'].fillna(X_train['native.country'].mode()[0]) X_train['occupation'] = X_train['occupation'].fillna('X') 이렇게 해주셨는데 m1 = X_train['workclass'].mode()[0] m2 = X_train['native.country'].mode()[0] X_train['workclass'] = X_train['workclass'].fillna(m1) X_train['native.country'] = X_train['native.country'].fillna(m2) X_train['occupation'] = X_train['occupation'].fillna('X') 이렇게 저만의 방식으로 기호 만들어서 활용해도 되나요?
안녕하세요 ! 수업 들으면서 열심히 실기 준비하고 있습니다 섹션5. 라이브러리 및 데이터 불러오기 강의에서 #상관관계 코드를 입력할 때 아래와 같이 뜨는데 corr(numeric_only=True) 형식으로 바뀐건가요?? # 상관관계 X_train.corr() # 판다스 버전이 최신으로 변경될 경우 에러 발생할 수 있습니다. 아래와 같이 numeric_only=True를 사용해주세요! sum(), mean()등도 모두 포함 # X_train.corr(numeric_only=True)
강의에서는 수치형 변수 스케일링 부분을 cols = [ 수치형 변수들] 변수 선언 후에 적용하셨는데 제 생각에는 이미 그 위에서 n_train, c_train, n_test, c_test 로 구분해 놓았기 때문에 불필요하다 생각해서 아래와 같이 작성했는데, 오류가 발생합니다. 왜그러는 걸까요? from sklearn.preprocessing import RobustScaler scaler = RobustScaler() n_train = scaler.fit_transform(n_train) n_test = scaler.transform(n_test) n_train.head() #오류내용 AttributeError: 'numpy.ndarray' object has no attribute 'head'
과거에 파이썬을 배울때 df[출력행][조건] 이런식으로 배워서 익숙한데 2회 기출유형(작업형1) 3번 문제 마지막은 df[조건][출력행] 으로 되어 있어 궁금한 점이 있습니다. 순서는 상관이 없는건가요? 전 아래와 같이 코딩했고 결과값은 같습니다. print(df['age'][cond1|cond2].sum())
강의에서는 name, host_name, last_review, host_id를 삭제하고 reviews_per_month는 0으로 대체했습니다. 근데 예를 들어 이 문제가 시험에 출제되었다면, 강의처럼 똑같이 해야 점수를 획득하는건가요? 다른 컬럼들을 더 삭제하거나 위에 컬럼들 중 일부를 삭제하지 않으면 점수가 깎이는건가요?
집합(SET) 활용하여 차집합 개념은 잘 이해했습니다. a-b 가 존재할 경우 레이블 인코딩 하면 문제가 없는 것 b-a 존재할 경우 학습시 b에 존재하는 컬럼이 인코딩이 안되는 문제! 이럴 경우엔 axis=0(열)로 합해서 인코딩 후 다시 분리하는 방법이 있다고 하셨는데 그렇게 하지않고 인코딩 할때 fit을 b(test) 로 하고 트랜스폼을 a(train)으로 하면 무슨 문제가 발생할까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 책은 따로 구매하지않고 강의만 보고 진행할 생각인데 그럼 책에 있는 미션일 경우 그냥 끝이나는 건가요? 아니면 문제는 제공되나요?
작업형1 모의문제3 문제9관련 질문입니다. 해설을 보고 코드를 작성했는데, 결과값이 11이 아니라 np.int32(11)로 나옵니다. 무엇이 잘못되었을까요? 문제9 구독(subscribed) 월별로 데이터 개수를 구한 뒤 가장 작은 구독 수가 있는 월을 구하시오 # your code import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv") df['subscribed']=pd.to_datetime(df['subscribed']) df['year']= df['subscribed'].dt.year df['month']= df['subscribed'].dt.month df['day'] =df['subscribed'].dt.day df= df.groupby('month').count() df.sort_values('subscribed').index[0] =>np.int32(11)