실제 시험에서 너무 정확한 점수(높은)가 나오면 과적합을 의심해야 할까요? import pandas as pd # 다중분류 문제 train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p2/drug_train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p2/drug_test.csv") target = train.pop('Drug') # train, test 둘다 결측치 없고, 종류수 같음 cols = train.select_dtypes(include='object').columns # baseline # train = train.drop(cols, axis=1) # test = test.drop(cols, axis=1) # one-hot # train = pd.get_dummies(train, columns = cols) # test = pd.get_dummies(test, columns = cols) # Label from sklearn.preprocessing import LabelEncoder for col in cols: le = LabelEncoder() train[col] = le.fit_transform(train[col]) test[col] = le.transform(test[col]) # 학습 데이터 분리 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split( train, target, test_size=0.2, random_state=0 ) # 모델 학습 from sklearn.ensemble import RandomForestClassifier model = RandomForestClassifier(random_state=0) model.fit(X_tr, y_tr) pred = model.predict(X_val) # 모델 성능평가 from sklearn.metrics import f1_score score = f1_score(y_val, pred, average='macro') print("F1 Score: ", score) # baseline F1 Score: 0.5535714285714286 # one-hot F1 Score: 0.8809523809523809 # Label F1 Score: 1.0 # 모델 예측 pred = model.predict(test) pd.DataFrame({ 'pred': pred }).to_csv('result.csv', index=False) pd.read_csv('result.csv')
필기 합격하고 실기 준비에 답답했었는데 강사님 덕분에 빅분기 실기 재밌게 잘 준비하고 있습니다. 실기 체험환경에서 유형3을 하고 있는데요. 회귀분석에서 새로운 값을 가정했을 때, 신뢰구간과 예측구간을 묻는 문제에서 print(pred.summary_frame()) 이것의 결과값이 길어서 중간에 '...' 으로 나오는데 전부 다 보려면 어떻게 해야 되나요 강의 어느 부분에서 방법을 말씀해 주셨었는데 강의 어느부분인지 기억이 안나요..
안녕하세요. 목차를 살펴보다가 이상한 점을 발견해서 문의합니다. (책 맨 앞의 목차가 아니라 "목차 메뉴"의 출력이 이상해서 문의합니다.) 저는 알라딘에서 전차잭으로 구매했는데 홈페이지 상세 페이지에서는 순서가 제대로 잘 나와있는 것 같은데... 제 전자책에서는 목차가 이상하게 출력됩니다. 챕터10 -> 파트4(300페이지) 챕터14~17까지 순서대로 나오다가 -> 챕터 11~13까지 나옵니다. 이건 해당 구매처로 문의해야 하는 걸까요?
안녕하세요. Linux kernel 강의를 듣고 있는 수강생입니다 제가 Crash utility 를 이용해서 쉽게 해당 dump 의 최종 프로세스의 cpu 번호는 알 수 있는데, 만약 현장에서 Crash Utility 설치가 불가피해서 사용을 못하고(시간상이나 알수 없는 원인으로 설치가 안될때) 오직 TRACE 32 만으로 SMP(멀티코어) 시스템의 DUMP 발생 원인이 된 프로세스의 CPU 번호를 파악하고 싶을때는 어떤 방법을 이용할 수 있을지 궁금합니다. 예를들어 아래와 같이 상황에서 해당 Soft IRQ 를 발생시킨 CPU 번호를 오로지 TRACE 32 를 이용해서 찾아야 한다고 했을때 , 어떻게 해야하는지 궁금합니다 사실 교수님께서 설명하셨던것 같은데, 기억이 잘 안나서요. 죄송합니다.... 감사합니다.
해당 문제를 아래와 같이 풀었습니다. # your code import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv") df=df.fillna(method='bfill') df=df.groupby(['city','f2']).sum().reset_index() df=df[['city','views']].sort_values(by='views',ascending=False) df= df.reset_index(drop=True) df=df.loc[2:2] df print("대구") 해당 마지막 코드인 df=df.loc[2:2]를 통해서 정답이 '대구'인걸 눈으로 확인했는데 해당 값만 추출하는 것을 몰라 마지막에 print를 활용해서 정답을 '대구'로 출력했는데 이와 같은 경우 괜찮은지 질문드립니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 df = df.fillna(method='bfill') df = df.bfill() ffill도 마찬가지로 선생님, 왕초보의 질문인데요..! bfill과 fillna(method='bfill')이 완전히 똑같은 기능을 하나요? 그렇다면, fillna(method='bfill') 가 조금 더 코드가 긴데, fillna 를 까먹지 않도록 이걸로 알려주시는 걸까요?
안녕하세요, 저는 알려주신 코드와 동일하게 작성한 것 같은데, 결과 값이 'id'로 나오는데 뭐가 문제일까요 import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p1/members.csv") df = df.isnull().sum() print(df.sort_values(ascending=False)) print(df.index[0]) 11:06초 먼저 유사한 질문이 있었는지 검색해보세요
Pypi(파이썬 레지스트리) 이용법에 대해서 알아보기 강의에서 보면 좌측에서 packages를 클릭하고 prettytable을 설치하는데 지금의 Replit UI에서는 packages를 찾아보기가 어렵습니다. 뒷 강의에서 계속 package를 설치하고 진행하게되면 그냥 넘어가면 안될것같아서 문의 드립니다.
파이썬으로 제작된 강의가 두개가 있는데 비슷하면서 차이가 있더라구요 - 백트래킹 / 완전탐색 - 동적계획법 (DP) - 위상정렬 - 플로이드-와샬 - 힙(Heap) - 고급 시뮬레이션 프로젝트 - 파스칼 응용 / 순열 / 조합 실습 대략 보기로는 최신강의에서 이 내용이 빠져있는것같은데 두 강의 모두 수강해야하나요?
안녕하세요 질 좋은 강의 올려주셔서 항상 감사합니다. 몇가지 질문을 하고싶은데 traget=train.pop('타겟') << 이거를 인코딩 하기 전에 하는것이 나을까요 아니면 검증데이터 분할하기 전에 하는것이 나을까요? 학습시간이 촉박해서 그런데 인코딩에서 레이블인코딩을 학습하지 않고 그냥 원핫인코딩 하나만 학습해서 시험을 쳐도 무리 없을까요? 그리고 머신러닝 학습에서도 lightgbm이나 XGBoost나 다른 모델을 쓰지않고 그냥 랜덤포레스트 하나만 학습해서 시험을 쳐도 합격하는데는 큰 무리가 없을지 궁금합니다! 감사합니다 추가적으로 작업형 2에서 이상치 조정, 스케일링, 하이퍼 파라미터 튜닝 이 세가지 작업도 굳이 하지 않아도 점수에 큰 영향이 없다면 패스하고 싶은데 괜찮을지 여쭤봅니다!!