안녕하세요! 수업 강의 잘 듣고 있습니다 궁금한게 있어서 문의 남깁니다! numeric_only=True는 이번에 시험환경이 업데이트 되어, sum이나 corr 를 사용할때 붙이는 걸로 인지했습니다. 공부하던 도중에 어떤 곳은 inplace=True가 붙고 어떤 곳은 안붙어서 혹시 어느 때에 쓰면 되는지 궁금합니다! 원본 객체를 그대로 쓰며 수정하겠다는 의미 자체는 알겠는데.. df.dropna() 이런 곳에도 붙고 여기저기 붙는것같아서 명확히 알면 좋을 것 같습니다!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 # 5) 제출파일 생성 # from sklearn.metrics import mean_squared_error # def rmse(y_true, y_pred): # return mean_squared_error(y_true, y_pred) ** 0.5 # print(rmse(y_val, pred)) # pred = rf.predict(test) # submit = pd.DataFrame({'pred':pred}) # submit.to _csv('result7.csv', index = False) 파일확인 print( pd.read _csv('result7.csv').head(5)) 이렇게만 하면 자동제출 되는건가요? 아니면 따로 제가 제출하기위해서 뭔가를 클릭해줘야하는 환경인가요...? 시험환경을 잘모르겠어서 질문드립니다.
랜덤포레스트 후 rmse 값을 구할 때 이렇게 구해도 상관없을까요?? from sklearn.ensemble import RandomForestRegressor from sklearn.metrics import mean_squared_error import numpy as np rf=RandomForestRegressor(random_state=0) rf.fit(X_tr,y_tr) pred=rf.predict(X_val) mse=mean_squared_error(y_val,pred) rmse=np.sqrt(mse) print(rmse)
단순 선형회귀 분석에서 잔차를 구할때 잔차 = df[종속변수] - model.predict(df['독립변수]) 이렇게 구하는데, 다중선형 회귀분석에서 구하는 방식인 model.resid 으로 구해도 되는지 문의드립니다. 잔차제곱 평균을 mse라고 할때 mse = (model.resid **2).mean()으로 구하는데, 마인드맵에서 잔차의 평균제곱오차 (MSE) = model.mse_resid로 나타나있는데 두 개의 값이 다르게 나오는데 혹시 다르게 나오는 이유를 알려주시면 감사하겠습니다! 작업형3 회귀분석 관련 범주형 변수일때 원핫 인코딩을 적용하게 되면 숫자로 안바뀌고 True,False로 값이 뜨는데, 이유와 어떻게 숫자로 바꿀수 있는지 알려주시면 감사하겠습니다!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 pred 1 15586.88 2 15407.71 3 14912.47 4 18482.73 5 6168.01 6 16953.75 기출 5회 정답파일 제출 Value값인 pred가 책이랑 다른데, 이럴수가 있나요? 제출한다면 선생님꺼랑 똑같은 인덱스에 똑같은 pred값이 들어갔어야할텐데,,, random_state도 똑같이 전부 0으로 맞췄는데 이럴수가 있나요?
강의서에서 잔차이탈도는 model = glm(formula, data=데이터, family=sm.families.Binomial()).fit() 이렇게 구하는것으로 나와있는데, 작업형3 마인드맵 자료 주신거에는 로그우도 : model.lif 잔차이탈도 : -2 * model.lif 이렇게 되어 있는데, 로그우도, 잔차이탈도 모두 logit summary에서도 확인할 수 있는것인지 궁금합니다!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 2개의 파일, 3개의 파일도 연습해봐야 한다고 말씀하셨는데 시험에서 train, test 데이터 외에 다른 파일이 있을수도 있다는 말씀이신건가요?? 만약 그렇다면 어떤식으로 데이터를 나눠야하고 그래야하는지 잘 모르겠습니다 ㅜㅜ 추가로 마지막에 y_test 데이터는 따로 만들어야하는 데이터인지도 궁금하구요 추가로 랜덤포레스트랑 lightgbm 말고 xgboost 도 꼭 알아야 하는건가요?
[기출7회, 작업형3번, 문제 1번] 문제: 주어진 조개 데이터 300개 중 앞에서부터 210개는 train 데이터로 만들고, 나머지 90개는 test데이터로 만든다. 강의 해설 : train = df.iloc[:210] test = df.iloc[210:] 저의 풀이 train = df[:int(len(df)*0.7)] test = df[:int(len(df)*0.3)] 저의 풀이로 진행했을 경우 1-1, 1-2번 답은 강의와 동일한데 1-3번 오류율 구할때 답 차이가 나네요 ㅠ 강의 0.478 저의 답 : 0.5 train = df[:int(len(df)*0.7)] test = df[:int(len(df)*0.3)] 이렇게 분리하면 안되는걸까요?
안녕하세요 주말코딩님. 저는 완전 문과 노베이스고 지금은 대기업 하청 전산실 OP로 일하면서 정보처리기사 실기 시험을 주말코딩님 강의를 보며 준비해왔습니다. 주말코딩님의 강의를 보면서 23/24년도의 기출 혹은 그걸 기준으로 한 다른 강좌 실기 코딩 문제를 풀었을 때 어느 정도 자신감과 이해를 쌓을 수 있어 좋았는데 25년도 코딩 문제에선 자바 static 문제?, 예외처리, c 아스키 문제 같은 것들은 이해도 잘 되고 맞췄지만 이외 문제들은 싸그리 손도 못 대는 수준이었거든요. 4-50점 사이로 불합한 거 같은데 지금 시점에서 어떤 식의 학습, 방향성이 필요할까요? 또 기사에서 한계를 느끼고 저 같은 경우 실무에서 아예 관련 내용을 다룰 일 없이 단순 업무 위주인데 기사에서 한계를 느끼면 주말코딩님의 강의로 산업기사 대비를 해도 괜찮을지요. 좋은 강의 합리적으로 제공해주셔서 감사합니다.
해당 건 랜덤포레스트 + 강사님이 최근에 공지 올리신 chat GPT 통해서 진행하는 건이요. train, test = train.align(test, join='left', axis=1)해도 에러가 뜨더라구요. 확인해보니 NaN이 많고, float64에러(?) 발생되어 train, test = train.align(test, join='left', axis=1) 밑에 한번 더 test = test.fillna(0)를 해줘야 에러메시지가 없어지던데 어떻게 구성해야되나요? 체험환경 문제조차 못풀고있는 제가 답답하네요.. ㅋㅋㅋ
안녕하세요 인프런과 시나공을 열심히 하고 있는데요 지난번에도 질문을 드렸는데 계속 안돼서 다시 질문드립니다 ㅠ 한 셀에서 연습중인데요 쌤 말씀대로 target = train.pop('TotalCharges') --> 실행하고 밑에 겟더미스 실행하면 ---> KeyError : 'TotalCharges'가 나옵니다.. 다른 문제에서도요 똑같이.. 그래서 저 train.pop부분을 주석처리하고 연습하긴 하는데 이게 맞는건가요??ㅜ 그리고 2유형은 시나공에 나와있는 코드를 모두 한 셀에 적어서 결과파일 만들어서 제출하는거 맞죠?? #데이터 전처리 target = train.pop('TotalCharges') print(train.shape, test.shape) train = pd.get_dummies(train) test=pd.get_dummies(test) print(train.shape, test.shape)