train_test_split() 함수내에서 y_train 을 나누는 방법에 차이가 있는 이유가 무엇일까요? 첫번째 사진은 y_train['Reached.on.Time_Y.N'] 으로 했고 열에 값이 출력되지 않았는데, 두번째 사진은 y_train.drop('ID', axis=1) 로 했는데 열값이 1이 나왔습니다. 두 방법 모두 결국에는 y_train에서 'Reached.on.Time_Y.N' 만 남기는 것은 동일한데 왜 열값의 출력이 다른지 궁금합니다.
안녕하세요. 작업형 2 회귀모델 사용하고 평가지표로 모델 평가하는 부분에서 질문이 있어서 문의합니다 넘파이 없이 해보려고 아래처럼 간단하게 만들어봤는데요. from sklearn.metrics import r2_score, mean_absolute_error, mean_squared_error # 릿지 모델 from sklearn.linear_model import Ridge rd = Ridge(random_state=100) rd.fit(X_tr,y_tr) pred_rd = rd.predict(X_val) mse = mean_squared_error(y_val,pred_rd) # rmse 간단 사용을 위해 우선 mse()를 변수 할당 rmse = mse ** 0.5 # 그런 다음 rmse 처리 방식에 맞는 변수 생성 print("r2:",r2_score(y_val,pred_rd)) print("mae:",mean_absolute_error(y_val,pred_rd)) print("mse:",mean_squared_error(y_val,pred_rd)) print("rmse:",rmse) r2: 0.06396849293045404 mae: 75.39756630227993 mse: 62725.96352602316 rmse: 250.4515193126669 # 라쏘 모델 from sklearn.linear_model import Lasso ls = Lasso(random_state=100) rd.fit(X_tr,y_tr) pred_ls = rd.predict(X_val) mse = mean_squared_error(y_val,pred_ls) rmse = mse ** 0.5 print("r2:",r2_score(y_val,pred_ls)) print("mae:",mean_absolute_error(y_val,pred_ls)) print("mse:",mean_squared_error(y_val,pred_ls)) print("rmse:",rmse) r2: 0.06396849293045404 mae: 75.39756630227993 mse: 62725.96352602316 rmse: 250.4515193126669 선형회귀,XGB,랜덤포레스트 등은 결과값이 모델별로 각각 다르게 나왔는데 (랜덤포레스트의 결정계수 값이 제일 높아서 실습하면서 저도 랜덤포레스트를 적용했습니다) 릿지랑 라쏘 이 2가지 모델은 위에서 처럼 결과값 출력이 완전 동일하게 나와서..... (rmse는 선형회귀를 제외한 나머지 4가지 전부 동일 값이 출력 되었습니다...이건 뭘 잘못한걸까요..?) 검증데이터 예측값 계산 변수 다 할당했고, 할당한 예측 변수를 각 평가 모델에 대입했는데... 왜 이런 결과가 나오는지, 뭔가 잘못한 부분이 있으니 값이 같게 나오는거 같은데... 어느 부분이 잘못 되었는지 알려주시면 감사하겠습니다.
- 학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! - 먼저 유사한 질문이 있었는지 검색해보세요. - 서로 예의를 지키며 존중하는 문화를 만들어가요. - 잠깐! 인프런 서비스 운영 관련 문의는 1:1 문의하기를 이용해주세요. 아래와 같이 하니 프레임 전환 없이 본문 입력이 됩니다. 이렇게 해도 되나요? 다른 문제는 없을까요? # 내용 입력 iframe = driver.find_element(By.CSS_SELECTOR, "#content > div.contents_area > div > div.editor_area > div > div.editor_body > iframe") iframe.click() iframe.send_keys("안녕하세요.", Keys.ENTER)
안녕하세요 강의 잘 듣고 있습니다! 작업형2 관련 질문 세개 있습니다. Q1) 랜덤포레스트 하이퍼파라미터 조절 max_depth나 n_estimator (아래처럼 ) 분류가 아닌 회귀분석일때도 사용해도 되나요?? Q2) 데이터개수가 너무 많으면 원핫인코딩보다 라벨인코더가 낫다고 하셨는데 개수가 많은 기준이 보통 어느 정도인지 궁금합니다! Q3) 검증데이터 분리 시에 test_size는 어느 정도가 적당한지 궁금합니다. 데이터가 적으면 0.1 ~ 0.15 아니면 0.2 정도로 해도 될까요?
선생님, 강의 내용 a = a[:int(len(a)/2)] cond = a['target'] == 0 a = a[cond] print(int(a['proline'].mean())) 에서 a = a[:int(len(a)/2)] a = a['target'] == 0 <-- cond 대신 a a = a[a] <-- cond 대신 a print(int(a['proline'].mean())) 로 실행해보았습니다. 데이터 프레임 값을 새로 갱신해 저장하는데, 'proline'에서 오류가 나는 이유가 궁금합니다. 새로운 조건명(con)을 넣어야만 실행되는지 궁금합니다.
강의 내용 외 개인적인 실습 사이트의 질문은 답변이 제공되지 않습니다. 문제가 생긴 코드, 에러 메세지 등을 꼭 같이 올려주셔야 빠른 답변이 가능합니다. 코드를 이미지로 올려주시면 실행이 불가능하기 때문에 답변이 어렵습니다. 답변은 바로 제공되지 않을 수 있습니다. 실력 향상을 위해서는 직접 고민하고 검색해가며 해결하는 게 가장 좋습니다. 네이버에서 뉴진스 검색하면 view 탭이 없어서 카페 탭으로 대신 이동해보려고 합니다. XPATH 사용해서 카페로 이동할 때 >>"//*[text()='카페']"<< 이 방식을 사용하려고 하는데요 웹에서 '카페' 키워드 검색하면 텍스트가 6개 나옵니다. 원하는 요소 text가 여러개 있는 경우 어떻게 찾아나가는지 궁금합니다. 아래와 같이 해봤는데 안되었어요. driver.find_elements(By.XPATH, "//*[text()='카페']")[3].click()
반복문을 이용해서 1~50주차.txt 파일 생성할때 str(i) +"주차.txt" 이렇게 작성해주셨는데 이때 str(i)가 아니라 "{0}주차.txt".format(i) 로 하면 코드 실행이 안되더라구요! .format 은 프린트문에만 사용이 가능한건가요? 그리고 파일 내용 작성 시 프린트문 하나안에서 \n 을 사용해 행을 바꾸지 않고 줄 수만큼의 print문을 작성하는 이유가 궁금합니다
좋은 강의 감사드립니다. 기출 문제를 풀던 중 의문사항이 몇 가지 생겨 질문드립니다. <첫 번째 질문> 2번 문제의 '전체 교사 수'를 구하라고 되어있는데, 선생님의 풀이를 보면 교사1인당 수가 출력되어 있습니다. 전체 교사 수를 출력해야하니 교사수 열의 값이 답으로 도출되어야 하지 않습니까? 문제의 오타인지, 제가 오해하고 있는 것인지 알려주시면 감사하겠습니다. <두 번째 질문> 총 범죄 건수의 월평균 값을 출력하라고 되어 있는데, 선생님의 풀이를 보면 월합계가 출력되어 있습니다. 해당 연도의 총 범죄 건수의 월평균 값을 구하려면 월합계 / 6이 되어야 하는 것이 아닌가 싶어 질문드립니다. 감사합니다.
여기서 나온대로 코드를 짜진 않았고 제 마음대로 했는데요. macro f1-score으로 평가한다고 해서 평가모델을 만들어서 넣어봤는데, 0.52가 나왔습니다.. 이 0.52 라는 숫자가 작은 것 같은데 하이퍼파라미터튜닝을 해도 고만고만 하더라고요. 근데 3회차에서 roc_auc_score로 검증해봤을땐 0.7 정도가 나왔던거 같아요.. 제가 검증하는 숫자가 낮은지 높은지 기준은 없는건가요? 그리고 최종 파일을 컴피티션에 올리면 점수가 나온다고 했는데, 거기서는 0.31이 나왔는데요.. 선생님은 0.3 쯤이 나왔는데 별 신경을 안쓰시길래.. 무슨 차이인지 몇점이 나오든 그거는 상관 없나요? @.@;;
안녕하세요 boto3 라이브러리를 처음 사용하는 강의에서 import한 라이브러리(boto3)와 실행하는 파이썬 파일( boto3.py )의 이름이 동일한데 어떻게 실행이 되는건가요 ?? 일반적으로 파이썬 사용할 때 라이브러리명과 파일명이 동일하면 AttributeError 에러가 발생하던데 강의에선 별 다른 제약 없이 실행이 되는거 같아 질문드립니다.
아래 코드에서 잘못된 부분은 없는지, 어느 부분을 보완하면 좋을지 알고 싶습니다 문제 : 학습용 데이터 (X_train, y_train)을 이용하여 생존 예측 모형을 만든 후, 이를 평가용 데이터(X_test)에 적용하여 얻은 예측값을 다음과 같은 형식의 CSV파일로 생성하시오(제출한 모델의 성능은 accuracy 평가지표에 따라 채점) 코드 : # 라이브러리 불러오기 import pandas as pd train = pd.read_csv("train.csv") test = pd.read_csv("test.csv") # EDA train.shape, test.shape # ((891, 12), (418, 11)) train.isnull().sum() test.isnull().sum() # 전처리(결측치, 인코딩, 스케일링, 타겟) train = train.dropna() test = test.dropna() train.shape, test.shape # ((183, 12), (87, 11)) train.describe() train = pd.get_dummies(train) test = pd.get_dummies(test) target = train.pop("Survived") # 모델링 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size = 0.2, random_state = 2024) from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state = 2024) rf.fit(X_tr, y_tr) pred = rf.predict(X_val) # 평가 from sklearn.metrics import accuracy_score accuracy = accuracy_score(y_val, pred) # 제출 result = pd.DataFrame({ "PassengerId" : X_val["PassengerId"] , "Survived" : pred }) result.to_csv("수험번호.csv", index = False)