df = pd.read _csv('../input/bigdatacertificationkr/basic1.csv') print(df['f1'].sort_values(ascending=False).head(12)) print(df['f1'].sort_values(ascending=False).iloc[9]) print(df['f1'].sort_values(ascending=False)[9]) 위의 코드를 실행하면 하나는 88, 하나는 74가 나옵니다.. 74는 어디서 나오는 건지 모르겠어요.. print(df['f1'].sort_values(ascending=False)[0])은 NaN나오덴데.. 그냥 인덱싱하면 행을 나타내진 않나요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 train = train.drop('ID', axis=1) test_ID = test.pop('ID') 의 경우 한번 삭제되면 그 다음부터는 이미 삭제 되었기 때문에 오류로 뜨는 것으로 알고 있습니다. 실전에서는 하나의 코드에서만 할 수 있는데, 이럴 때는 어떻게 해야하나요? 한번만 실행시키고, 그 다음부터는 지워야 하나요?
안녕하세요..^^ 대응표본 t 검정에서 정규성 검정을 할 때 강의에서는 afrer와 before의 차, 즉 diff를 이용했는데, 다른 자료들을 보면 shapiro(afrer), shapiro(before)와 같이 차를 이용하기 보단 각각에 대한 정규성을 검정하는 것으로 소개된 것들이 많더라구요... 둘 사이의 차이가 분명히 있을 것 같은데, 어떻게 이해해야 하나요?
안녕하세요, 문제에서 보면 제출 csv 파일형식 예시라고 해서 pred 결과값이 0,1 값으로 구성되어 있는데, pred 확률값으로 제출하는게 맞는지 궁금합니다. 문제에서는 남성을 예측하라 / 여성을 예측하라는거 없이 성별 예측결과를 저장하라고 되어있습니다. 그럼 predict_proba가 아닌 predict 함수를 써야되는게 아닌가 싶어서요 roc_auc_score 평가시에는 반드시 predict_proba를 사용해야되는게 맞을까요? (roc_auc_score 평가시 predict로도 일단 코드는 돌아갑니다.)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 unamed:0 칼럼에 대해 질문드립니다. (사진에서 첫번째 칼럼) unamed:0 칼럼은 시험 때 제출해야할 ID와 관련된 것이 아닌가요? ㅜㅜ 중간에 test_id 안 만드셔서 의문점이 들었어요.
# 데이터 불러오기 import pandas as pd train = pd.read_csv("train.csv") test = pd.read_csv("test.csv") y_train = train.pop('price') X_train = train X_test = test #print(X_train.head(3)) #print(y_train.head(3)) #print(X_test.head(3)) #print(X_train.info()) X_train = X_train.drop(columns = ['model', 'transmission', 'fuelType']) X_test = X_test.drop(columns = ['model', 'transmission', 'fuelType']) #print(X_train.info()) #print(X_test.info()) from sklearn.ensemble import RandomForestRegressor model = RandomForestRegressor() model.fit(X_train, y_train) model_pred = model.predict(X_test) #print(model_pred) pd.DataFrame({'pred':model_pred}).to_csv('수험번호.csv', index=False) 수험번호 = pd.read_csv("수험번호.csv") print(수험번호.head()) 선생님 안녕하세요 위와 같이 가장 기본형으로 작업을 했습니다. 맨 마지막에 파일을 불러오니 정수형이 아닌 소숫점까지 나오더라구요. 이걸 정수형으로 바꾸려면 어디에서 int를 씌워야 할까요? (참고로 선생님께서도 소수점으로 제출하셨지만, 만약에 정말 시험이라면 정수로 제출해야겠죠?) int(model_pred)해도 오류가 나오고, 맨 위에서 아얘 처음부터 해도 오류가 나오네요... 2 코딩을 선생님께 배운지 2주도 채 되지 않아 가장 기본형으로 진행하려고 합니다. 보통 기본형으로 해도 30점 이상 받을 수 있을까요? 일반적으로 후기에 따르면 어느정도일지 궁금하네요. 매번 감사드립니다 ^^
좋은 강의 감사합니다. 제목에 기재한 메소드들에 대해 실습하다 헷갈리는게 있어서, 개념 정립차원에서 정리글을 작성해봤는데, 맞는지 확인 좀 부탁드려도 될까요? //////////////////////////////////////////////////////////////////////////////////////////// 예: trian데이터 셋에서 작업, "A","B" 칼럼에 결측치 있다고 가정 @@@ drop() // 삭제 메소드 @1개의 특정 칼럼(열) 삭제 train = train.drop(["A"], axis=1) # "A" 로 해도 진행 됨. @1개의 특정 (칼럼에 해당 하는) 행 삭제 train = train.drop(인덱스값, axis=0) @ 복수의 특정 칼럼(열) 삭제 train = train.drop(["A","B"], axis=1) @ 복수의 특정 (칼럼에 해당 하는) 행 삭제 train = train.drop([인덱스값들], axis=0) @@@ dropna() // 결측치 삭제 메소드 @ 결측치 존재하는 칼럼 전체삭제 train = train.dropna(axis=1) @ 결측치 존재하는 행 전체삭제 train = train.dropna(axis=0) #axis=0 은 기본값이라 생략가능. @ 복수의 결측치 존재 칼럼(열) 삭제 train = train.dropna(["A","B"], axis=1) 에러 : TypeError: DataFrame.dropna() got multiple values for argument 'axis' @ 복수의 (특정 칼럼 내) 결측치 존재 행 삭제 train = train.dropna(subset=["A","B"], axis=0) # train이라는 데이터 셋을 대상으로( train. ), 결측치가 있는 것들 행(axis=0 이 기본)을 제거할 것인데( dropna() ), 그 결측치 우뮤의 기준은 "A","B"칼럼이다 (subset=["A","B"]) @@@ fillna() // 결측치 채움 메소드 train.fillna(0) # train데이터셋의 결측치를 전부 0으로 채움 @특정 칼럼의 결측치들을 특정 값으로 동일하게 채움 train["A"] = train["A"].fillna(0) # "A" 칼럼의 결측치를 모두 0으로 채워 train의 "A"칼럼에 대입하고, 결과를 동일이름의 변수로 적용 @특정 행의 결측치들을 특정 값으로 동일하게 채움 # 어떤 인덱스(행)이 갖는 여러 칼럼을 동일한 값으로 채우는 경우는 사실상 없으므로, 알 필요 없음(...??) //////////////////////////////////////////////////////////////////////////////// 일단 여기까지 정리한게 다인데, @ 복수의 결측치 존재 칼럼(열) 삭제 train = train.dropna(["A","B"], axis=1) 이렇게 하면 오류 발생해서... dropna() 메소드로 결측치 존재하는 특정 칼럼만 지정해서 삭제하려면 어떻게 해야하나요? 그리고 fillna()메소드에서 @특정 행의 결측치들을 특정 값으로 동일하게 채움 이런 경우는 없을테니, 그냥 넘어가도 괜찮은지 궁금합니다.
선생님 안녕하세요! 기출 등에서 궁금한 점이 있어 질문드립니다. 1. 기출 1회 작업형 2에서 train데이터와 test데이터의 고유데이터 수가 다르다면 set을 사용하여 어떤 부분이 다른지 알 수 있는 방법을 알려주셨는데 그럼 이 부분을 어떻게 하면되는것일까요? 강의에서는 뭐가 나온건지만 알려주시고 따로 처리를 하시거나 그러지 않으신것같아서요! 2. 기출 2회 작업형 1에서 문제를 푸는데 아래와 같은 에러?워닝?이 떴는데 이유를 잘 모르겠습니다! 이걸 제거하려면 어떻게 해야할까요? 3. 작업형 1의 경우에 답을 꼭 마지막에 print()문으로 표시를 해줘야하는 것 맞을까요? 작업형 1,3 모두 따로 답변하는 란이 있는것같았는데 그럼 1,3 모두 풀이과정을 쓰는 곳에선 문제 각각 print()문으로 답을 표시해야 할까요??
선생님 안녕하세요~ 지금 T1 캐글 문제 풀어보고 있는데, import pandas as pd # 데이터 불러오기 df = pd.read_csv("../input/bigdatacertificationkr/basic1.csv") df.head(5) #f2가 0인 데이터 정렬 df2 = df.loc[df['f2']==0].sort_values('age', ascending = True) #앞에서부터 20개 데이터 추출 df2 = df2.iloc[:19] before = df2['f1'].var() df2['f1']= df2['f1'].fillna(df2['f1'].min()).var() after = df2['f1'].var() print(round(after-before,2)) 이렇게 했을 때 정답값이 저는 -390.68으로 나오는데, 선생님 풀이를 보면 정답 : 38.44으로 나오더라고요. 혹시 어디서 틀렸는지 알 수 있을까요? 앞에서부터 20개의 데이터 추출할때 저처럼 df2.iloc로 사용해도 무방한가요..?! ㅜㅜ # 앞에서 부터 20개의 데이터 df = df[:20]
안녕하세요 선생님 최근에 올려주신 강의를 통해 어떤 확률 값을 제출하는지 명시가 안되어 있을 경우에는 양성인 값 pred_proba[:,1]를 제출하는 것을 잘 알았습니다! 그러면 만약에 어떤 확률을 제출하라는 말이 없고 타겟값이 뇌졸중 0 : 뇌졸중 양성, 1: 뇌졸중 음성 이런식으로 되어 있을 경우에는 뇌졸중 양성인 pred_proba[:,0]을 제출하는게 맞을까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 분명 CSV 파일 예시는 pred 0 0 1 0 이렇게 되어있는데, pred[:,1]로 하면 확률로 표시되는데... 그래도 가능할까요?