df['f3'] = df['f3'].replace(np.nan, '0').replace('silver', '1').replace('gold', '2').replace('vip', '3') print(df['f3'].sum()) 이렇게 코드 작성 시, 202003010232022222222222221220231112102221022220222223101200121202012002200221032202021220121202라고 값이 뜨는데, 정수로 바꾼 다음에 합을 구할 때는 어떻게 하나요?
안녕하세요 선생님 작업형 2유형 관련해서 질문이 있습니다. 2유형에서 고득점을 목표로 하지 않기 때문에 간단하게 기본 공식만 외워가려고 생각중인데요 target = train.pop("A") train = pd.get_dummies(train) test = pd.get_dummies(test) from sklearn.model_selection import train_test_split X_tr,X_val,y_tr,y_val = train_test_split(train,target,test_size = 0.2, random_state = 0) from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state=0) rf.fit (X_tr,y_tr) pred = rf.predict(X_yal) pred = rf.predict(test) result = pd.DataFrame({'pred':pred}) result.to _csv("result.csv",index=False) print( pd.read _csv("result.csv").head()) print( pd.read _csv("result.csv").shape) 이런식으로 간단하게 문제에 맞춰 작성했을때 빨간색 하이라이트 부분을 제출을 하는건데 , 초록색 부분을 주석처리를 해줘야 하는걸까요? 아니면 주석처리 하지 않고 위에처럼 제출을 하면 될까요? 추가적으로 주석처리가 필요한 부분이 있으면 알려주십쇼!!
범주형 변수에 get.dummies를 이용하여 원핫인코딩 하는 작업 중 질문이 있습니다. train 데이터셋과 test 데이터셋의 컬럼수가 99개와 95개로 다릅니다. (다른 이유는 train 데이터셋과 test 데이터셋의 컬럼 중에 관측치가 다른 항목이 있기 때문이라고 하셨는데요, 그런 이유라면 다른 것이 정상인가요?) 그런데 영상에서는 100개로 나옵니다,, 강의 100개 vs 99개 컬럼 갯수가 다른 이유는 무엇일까요? 아래는 코드와 출력값 첨부드립니다. # 원핫 인코딩 n_train, n_test, c_train, c_test = get_nc_data() # 데이터 새로 불러오기 c_train = pd.get_dummies(c_train[cols]) c_test = pd.get_dummies(c_test[cols]) display(c_train.head()) display(c_test.head()) print(c_train.shape) print(c_test.shape)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 9번문제에서 시험때 제출할때 print(df.sort_values('subscribed').index[0]) 만 쓰면 될까요? 아니면 월별 데이터 갯수인 print(df)까지 해야하나요
안녕하세요! '앞에서부터 70% 데이터 중 views 컬럼의 3사분위 수에서 1사분위 수를 뺀 값을 구하시오' 이 부분에서 .loc을 사용했을 때와 그냥 슬라이싱을 했을 때의 행 개수 차이가 나서요.. 왜 이렇게 차이가 나는지 궁금해서 문의 남깁니다! 좋은 강의 준비해주셔서 고맙습니다 : )
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 이상치 제거를 df = df[(df[ 'age' ] == df[ 'age' ].astype( int ) ) & df[ 'age' ] > 0 ] 이렇게 하면 틀린건가요? round쓰는게 이해가 안가네요
아래의 코드를 입력하면 다음과 같은 에러가 발생합니다 KeyError : "['name', 'host_name', 'last_review', 'host_id'] not found in axis" 왜 이런 건가요?ㅠㅠ cols = ['name','host_name','last_review','host_id'] print(train.shape) train = train.drop(cols, axis=1) test = test.drop(cols, axis=1) print(train.shape)
레이블 인코딩 시 le = LabelEncoder() for col in cols: le = LabelEncoder() c_train[col = le.fit_transform(..) c_test .... for 문 전에 레이블 인코더를 호출하여 선언하고 for문 내에서 또 하는 이유는 무엇인가요? for문 시작 전 한번만 해 줘도 되는 게 아닌가해서 질문드려 봅니다.