학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 기출 5회 아래와 같이 풀어도 된다고 하셨는데 한가지 궁금한점이 생겨 재질문 드립니다. 질문1) 검증데이터분리를 한 것과 안한것에 대해 결과에 차이가 발생하나요? 차이가 발생한다면 어떤 이유 때문인지 알 수 있을까요? y=train.pop('price') train=pd.get_dummies(train) test=pd.get_dummies(test) from sklearn.ensemble import RandomForestRegressor rf =RandomForestRegressor(random_state=0) rf.fit (train,y) pred=rf.predict(test) submit = pd.DataFrame({'pred':pred}) submit.to _csv('result.csv', index=False)
오늘까지 수강을 들어서 섹션 10까지 수강을 완료했습니다. 이후 강의 중 필수적으로 수강해야 하는 강의가 궁금합니다. 섹션 11에 로지스틱 회귀(필수) 라고 되어있는것도 필수로 들으라는 의미 맞죠?? 선생님이 수강 할 강의 다 알려주시면 이후에는 문제 풀이만 계속 할 생각인데.. 기출문제 먼저 풀고 책에있는 예상문제 푸는게 나을지, 예상문제부터 푸는게 나을지 조언 부탁드립니다.
안녕하세요 선생님. 제가 수강을통해 배우기로는 decribe(include ='O')속성을 찍어봐서 unique개수가 맞지않으면 데이터를 합친 후 인코딩을 진행하는거로 알고있습니다. 강의중에는 평소에는 보통 그냥 train,test를 따로따로 인코딩 하시더라고요.(원핫에경우에도, 라벨인코딩일때는 train ->fit_transform, test->transform이런식으로). 저도 이 방식으로 하다가 원핫이든 라벨인코딩이든 unique개수가 같든 그냥 모두 데이터를 합친 후, 인코딩 한 후에 데이터를 다시 train과 test를 분할해 사용하고 있습니다 .(스케일링 필요할 경우에는 인코딩 후 스케일링 후 분할). 혹시 이 방법으로 계속 진행하고 시험환경에서도 그렇게 해도될지 질문드립니다. data = pd.concat([train, test], axis =0) print(data.shape) from sklearn.preprocessing import LabelEncoder cols = data.select_dtypes(include = "object").columns for col in cols: la = LabelEncoder() data[col] = la.fit_transform(data[col]) train = data[:len(train)].copy() test = data[len(train):].copy() print(train.shape, test.shape)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 아래 코드 안 쓸경우, # 데이터를 매번 새롭게 불러오기 위해 함수로 제작 함 def get_data(): train_copy = train.copy() test_copy = test.copy() return train_copy, test_copy 아래처럼 입력하면 되나요? from sklearn.preprocessing import MinMaxScaler scaler = MinMaxScaler() display(train[cols].head(2)) train[cols] = scaler.fit_transform(train[cols]) test[cols] = scaler.transform(test[cols]) display(train[cols].head(2))
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 시험이 코앞이나 아직 다른 방법을 시도해보기에는 에러가 너무 많이 떠서 아래와 같이 코드 작성하였는데 이렇게만 작성하면 너무 위험한 판단일지 조언 부탁드립니다. (문제에서 제시하고 있는 평가지표를 안사용하고 이런식으로 제출해도 될지 해서요,,! 이방법말고는 아직 숙달된 방법이 없어 문의드립니다) y=train.pop('price') train=pd.get_dummies(train) test=pd.get_dummies(test) from sklearn.ensemble import RandomForestRegressor rf =RandomForestRegressor(random_state=0) rf.fit (train,y) pred=rf.predict(test) submit = pd.DataFrame({'pred':pred}) submit.to _csv('result.csv', index=False)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요, 작업형 2번 답안 제출할때 평가지료(RMSE) 모델 작성 후 Print(result) 도 작성하고 답안 제출해도괜찮을까요? ,, 원래 print(result)도 출력하고 제출하는게 맞을까요?? (rmse 뿐만 아니라 모든평가지표도 동일한지 궁금합니다) ex( print(mse) print(f1) 등등) <코드> #학습 및 예측 from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state=0) rf.fit (X_tr,y_tr) pred = rf.predict(X_val) from sklearn.metrics import mean_squared_error def rmse(y_val,pred): mse = mean_squared_error(y_val,pred) return mse ** 0.5 result = rmse(y_val,pred) print(result) #제출 pred = rf.predict(test) submit = pd.DataFrame({'pred':pred}) submit.to _csv('result.csv',index = False)
안녕하세요 선생님! 질문이 있습니다. 저는 Graph attention Network (Layer 3개)를 통과할 때마다 얻어지는 attention map을 저장해놓고, (npy) 이를 clustering하고 있는데요, attention map을 flatten한 뒤 KMeans를 활용하고 있습니다. 이때 실루엣 스코어가 k를 늘려나감에 따라서 계속 올라간다면, 이상한 현상이라고 봐야할까요?? 이때 저는 cluster label은 가지고 있지 않아요. Davis bouldin이나 Calinski harabasz도 같이 보고 있는데, 그리고 elbow method로도요,, 그런데 이상하게 실루엣 스코어 결과 k를 50에 가깝게 내놓게 되고 실제로 plot을 그려보면 saturation을 하지 않고 계속 k가 늘어남에 따라서 실루엣 스코어가 늘어난다면 이상한 현상이라고 봐야할까요?? 감사합니다.
구름예시문제 작업형3에서 마지막 독립표본t검정 하라고해서 모수적검정 해도 되는지 확인 차 로그리지스틴 샤피로검정 했는데 1집단 샤피로검정 p값이 0.035네요 이런 경우 만휘트니검정을 해야하나요? 아니면 문제에서 제시한 대로 그냥 모수적검정인 독립표본t검정을 해야하는지 비모수적검정인 만휘트니유 검정을 해야하는지 궁금합니다
이번에 시험보고 탈락을 한 수험자입니다. 답안 작성시 풀이과정과 답을 함께 작성해야 한다고 해서 적잖게 당황하여 시간이 모자랐었는데 결국 떨어졌네요. 제 질문은 풀이과정을 반드시 써야하나요? '답' 칸을 제외한 나머지 공간에 동그라미와 밑줄을 치며 낙서를 해도 되나요? 풀이과정을 쓸 수 있는 공간 자체 부족해 보였는데 답답합니다. 속시원히 누가 얘기좀 해주면 좋겠습니다.