# your code import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv") #1 #print(df.shape) df = df.dropna(subset=['views']) #print(df.shape) #2 df['f3'] = df['f3'].fillna(0) df['f3'] = df['f3'].replace('silver',1) df['f3'] = df['f3'].replace('gold',2) df['f3'] = df['f3'].replace('vip',3) print(int(df['f3'].sum())) 이렇게 작성 후 실행하면 결과가 밑에 처럼 나옵니다. 133 <ipython-input-57-2ecc61ea0b50>:14: FutureWarning: Downcasting behavior in `replace` is deprecated and will be removed in a future version. To retain the old behavior, explicitly call `result.infer_objects(copy=False)`. To opt-in to the future behavior, set `pd.set_option('future.no_silent_downcasting', True)` df['f3'] = df['f3'].replace('vip',3) 문제 3번에서 두번째 점과 관련된 질문입니다. 강의에서 알려주신 넘파이를 꼭 사용해야 하나요? 이전 강의에서 넘파이에 대한 내용이 따로 언급이 없으셔서 혼자 문제 풀어볼 때 넘파이 사용하지 않고 풀어본 것인데.. 깔끔하게 133만 나오지 않아서요ㅜㅜ
안녕하세요 :) 현재 문제를 풀었을 땐, sklearn.metrics 에서 문제에서 주어진 모든 평가지표를 제공하고 있는데 시험 때도 동일하게 사용하면 될까요? from sklearn.metrics import r2_score, mean_absolute_error, mean_squared_error, root_mean_squared_error, root_mean_squared_log_error, mean_absolute_percentage_error lightGBM 모델을 사용하면 RMSLE에 대해 마이너스 값에 대한 에러가 발생하는데, 이 경우 해당 모델을 사용하지 않는 게 좋을까요? 문제에 제시된 모든 평가지표들에 대해서 에러가 안 떠야 채점 받을 때 불이익이 없는 건지 궁금합니다..! r-squared 값이 0.18 로 굉장히 작은 편인데.. 결과가 이럴 수도 있나요? 보니까 수업에서 배우지 않은 모델들도 굉장히 많은데 (ex. 릿지, 라쏘, XGBoost) , 분류/회귀 모두 '랜덤포레스트, lightGBM' 모델만 사용해서 문제를 풀어도 괜찮을까요? (여유가 되면 XGBoost 까지)
안녕하세요 :) '문제 2-2'에서 '문제 2-1'에 적합한 모델의 결정계수를 구하라고 돼있는데, 다중회귀분석은 수정결정계수를 봐야 하지 않나요? 다른 분의 같은 질문에 대한 답변을 보니까 '적합한'을 '작업한'으로 이해하면 된다고 하셨는데 '기출 7회 - 작업형3 - 문제 2-2'에서는 다중회귀분석의 적합한 결정계수를 구하는 건 수정결정계수를 구해야 한다고 하셨거든요. '적합한 모델'이든 '적합한 결정계수'든 '적합한'의 위치에 상관 없이 다중회귀분석의 결정계수는 수정결정계수를 봐야 하지 않나요?!
강의를 듣기전에 혼자 풀어보고 그러고 있는데 저는 아래와 같이 코드를 짜서 풀었는데 일단 답은 나오는데 이런식으로 앞으로 풀면 나중에 문제를 헤쳐나가기에 어느부분이 부족할까요 정말 단순하게 생각하고 짜본 코드입니다. ㅜ import pandas as pd df=pd.read_csv("data6-1-2.csv") df['학생전체']=df['1학년']+df['2학년']+df['3학년']+df['4학년']+df['5학년']+df['6학년'] #학생전체/교사수(교사한명당) df['교사한명당']=df['학생전체']/df['교사수'] df.sort_values('교사한명당',ascending=False) #re=df.groupby("학교명")["교사수"].sum() #re.sort_values()
안녕하세요 열심히 선생님거 보면서 빅분기학습하고 있습니다. 여러 문제 풀면서는 뭘 외워야 하는지도 잘 몰랐고 공부하면서 굉장히 복잡했는데, 확실히 한 가지 방법으로 풀기 강의를 보면서 문제를 푸니까 뭔가 그래도 잡히는 거 같아요 해서 최신 기출회차인 8회,9회도 한가지방법으로 풀기 colab으로라도 올려주실수 있는지 궁금합니다. 항상 늘 강의 잘 보고 있습니다.
안녕하세요! 24. 머신러닝 학습 및 평가 (분류) 25. 머신러닝 학습 및 평가 (회귀) 강의를 듣고 궁금한게 생겨서 질문을 남기고 있습니다! 0) 궁금증의 개요 : Train 데이터와 Test 데이터의 컬럼수가 차이가 날 때, 원핫 인코딩으로 풀기위해서는 합치기(concat) 와 분리를 사용하는 것으로 인지하고 있습니다. 1) 분류 문제의 경우 ① Train 데이터와 Test 데이터의 컬럼수가 차이가 남 -> 원핫 인코딩을 쓰려면 합치기 (concat) 사용 + 원핫 인코딩 사용 + 분리 -> 레이블 인코딩으로 합치기 (concat) 미사용하고, 풀이 진행함 2) 회귀 문제의 경우 ① Train 데이터와 Test 데이터의 컬럼수가 차이가 안남 ② 합치기(concat) -> 레이블 인코딩 -> 분리를 진행하고 풀이 진행함 3) 궁금한 점 ① 분류 문제에서 트레인 데이터와 테스트 데이터의 컬럼의 수가 다를 때, 원핫 인코딩으로 풀이 진행하려면 .concat 사용 -> 원핫 인코딩 -> 분리해야하는데 이 과정이 하기 싫으면 레이블 인코딩 사용하면 되나요??? ② Train 데이터와 Test 데이터의 컬럼수가 차이가 날때만, 원핫 인코딩에서 합치기와 분리를 진행하는거 아닌가요??? ③ 회귀 문제에서는 Train 데이터와 Test 데이터의 컬럼수가 차이가 안나는데, 왜 레이블 인코딩으로 합치기와 분리를 하신건가요??? ④ 회귀 문제에서 레이블 인코딩을 할 때, 왜 Test 데이터에는 트랜스폼을 진행안하신 이유가 있을까요? 분류 문제에서는 트랜스폼을 진행하셨는거 같은데 ㅠㅠ ⑤ 원핫 인코딩, 레이블 인코딩에서 합치기와 분리 순서가 맞는지 확인 부탁드려도 될까요? - 순서 : 합치기 -> 원핫,레이블 인코딩 -> 분리 ※ 제가 파이썬이 처음이라 궁금한점이 너무 많은거 같습니다 ㅜㅜ 번거롭게 해드려 죄송합니다ㅜㅜ
메일 전송을 커맨드로 지정해주셨는데, 어떤 상황에서 보통 사용되는지 궁금합니다. 그리고, 서비스 내에서 특정 상황에서 알아서 (python manage.py ~ 명령어를 터미널에 따로 입력하지않아도) 이메일을 보내게 하려는 것이라면 어떻게 커맨드로 설정해놓은 저 부분을 실행시키는지 궁금합니다.