데이터 분리 단계의 random_state 값을 10, 50, 100, 200, 2022 등등 여러바꾸어보았는데 r2값의 편차가 큽니다. 심하면 음수값도 나오고, 높아봐야 0.3정도 수준까지 나와요. (제공해주신 코드 그대로 쓰면 0.3에 근접하게 나오나, random_state값만 바꿔도 전반적으로 떨어집니다) 내가 뭘 잘못했나 하면서.. 혼자서 몇 시간 동안 전처리 단계에서 nunique 수가 많은 object 컬럼을 추가적으로 제거해도 마찬가지고 인코딩 단계에서 one-hot과 label을 바꾸어가며 써봐도 마찬가지고 모델학습 단계에서 하이퍼파라미터값을 조정해봐도 마찬가지입니다... gpt로도 요리조리 돌려봤는데 애초에 데이터의 질 자체가 나쁘면(편차가 큰 경우 등) 코드를 아무리 수정해봐야 평가값 결과가 불안정하게 나온다고 하는데 제가 뭘 잘못하고 있는건지, 해당 문제의 데이터에 문제가 있는건지 궁금해요. 그리고 이런 경우 실전에서도 이대로 풀이를 하고 제출해도 문제가 없을까요? randomstate 값만 바꿔가다가 train 데이터에서 결과 좋은 걸 찾아 끼워 맞춰봤자, test 데이터에서는 또 전혀 다른 결과가 나올 것 같아서요 (코드를 제가 잘못짰나 싶어서 공유된 코드 그대로 써도 마찬가지입니다.. random_state값 조금만 바꿔도 평가결과값이 크게 떨어짐)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 레이블인코딩말고 원핫인코딩으로만 통일해서 하려고 하는데 코드좀 알 수 있을까요 df = pd.concat([X_train, X_test]) df = pd.get_dummies(df) X_train = df.iloc[:len(X_train)] X_test = df.iloc[len(X_train):] print((X_train.shape, X_test.shape)) 이렇게 하면 될까요
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 마지막 범죄 건수 계산문제 질문드립니다. 수업 자료에 있는 코드와 아래 작성된 코드에서 어떤 차이가 있어서 결과가 다르게 나오는 것인지 문의드립니다. df['연도'] = df['날짜'].str[:4] df['월'] = df['날짜'].str[6:8] df['총합'] = df['강력범죄'] + df['절도범죄'] +df['폭력범죄'] +df['지능범죄'] +df['풍속범죄'] +df['교통범죄'] #월평균값이 가장 큰 연도 찾기 result = df.groupby(['연도','월'])['총합'].sum() result.head() #연도별로 총 범죄 건수(범죄유형의 총합)의 월평균 값을 구한 후 그 값이 가장 큰 연도를 찾아, 해당 연도의 총 범죄 건수의 월평균 값을 출력하시오. result2 = result.groupby('연도').mean() result2 = result2.sort_values(ascending = False) result2 #23년도 print(df.groupby('연도')['총합'].mean())
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 train = train.drop('id', axis=1) test_id = test.pop('id') 왜 트레인은 axis를 넣는데 테스트아이디는 저걸 넣지 않을껄까요
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 작업형2에서 평가점수를 높이기 위해 선형회기 랜덤포레스트 xgb등을 써보면서 높은 점수를 선택하셨던데, 제가 완전 초보여서 시험장에서 그럴여유가 있을지 모르겠습니ㅏㄷ... 그래서 그냥 랜덤포레스트 하나만 달달 외워서 만능으로 쓰면 안될까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 p_value가 0.05보다 적으니 귀무가설을 기각하고 대립가설을 채택한다고 생각했는데 귀무가설을 채택한다고 해서 제가 잘못 이해한건지 궁금합니다 stats.f_oneway(df[cond1]['scores'], df[cond2]['scores'], df[cond3]['scores'], df[cond4]['scores']) from statsmodels.formula.api import ols from statsmodels.stats.anova import anova_lm model = ols('scores ~ groups', data = df).fit() print(anova_lm(model))
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 Section 22. 시간 간의 차이 계산(분), 그룹핑 앱 종류별로 평균 도착 시간(분)을 계산하시오. -> 아래는 코랩에 올라온 코드인데요 # 실제 도착시간과 주문시간 차이 계산(분) df['diff'] = (df['실제도착시간'] - df['주문시간']).dt.total_seconds()/60 # 앱종류별 도착시간과 주문시간 차이의 평균 계산 df = df.groupby('앱종류')['diff'].mean() 앱종류별 평균도착시간을 구하려면 아래처럼 쓰이는게 맞지 않나 싶어 문의드립니다. df= df.groupby('앱종류')['실제도착시간'].mean()
안녕하세요 강사님~! 백엔드 서버 vercel 로 배포한 뒤 client 를 해당 백엔드 url 로 설정하여 npm run build 를 하니 401 에러가 발생을 해서요~ https://ddilys-library-server-lqprbor13-camomilekrs-projects.vercel.app/ This page requires authentication to access. Automated agents should use a Vercel authentication bypass token to access this page. build 과정에서 401 오류로 응답에 이런 내용이 포함되어 있는데, 별도의 auth token 같은 걸 설정해 줘야 할까요?? vercel --prod 로 deploy 해도 동일한 증상이 있습니다~ 답변 주시면 감사드리겠습니다~
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 1번에서는 두 조건이 맞는 그룹화를 다음과 같이 코딩하셨는데요 왜 3번에는 transform함수가 붙나요?? 두 경우 모두 두가지로 그룹화한다는 점에서 같아 보이는것 같아서 이해가 잘 안됩니다..! #1번 df=df.groupby(['지역코드','성별'])['총대출액'].sum().unstack() #3번 gm=df.groupby(['부서', '성과등급'])['근속연수'].transform("mean")
강사님께서 "작업형2 한가지 방법으로 풀기"에서 학습을 RandomForest로 진행하셨는데, "lightGBM 잘 활용하기"에서는 lightGBM 사용 시 인코딩이 필요가 없다고 하셔서, 오히려 한가지 방법으로 간단하게 풀려면 lightGBM이 더 적합해보이는데, lightGBM 하나로 쭉 밀고 나가도 문제가 없을까요? 그리고 분류 모델은 LGBMClassifier(random_state=0)인 걸로 영상에서 확인했는데, 회귀 모델은 나와있지 않아서요..! LGBMRegressor(random_state=0)으로 사용하면 될까요? 감사합니다.
체험 환경에서는 csv 파일을 직접 탭으로 열어서 볼 수 있게 되어 있던데, 실제 시험 환경에서도 동일한가요? 작업형 모의문제에선 df.head()로 csv 파일을 대략적으로 살펴보았는데, 만약 시험 환경에서도 csv 파일을 열어볼 수 있다면 이 과정이 필요하지 않을 것 같아 질문드립니다. 감사합니다.