작업형 2을 여러 데이터를 구해서 해보고 있는데 하이퍼 파라미터 변수를 조정해서 평가결과를 보면 학습률이 높거나 트리가 깊어야 점수가 좋게 나오는 경우가 있는 것 같습니다 예를 들면 대중적으로는 아래처럼 쓰는데 n_estimators=500, learning_rate=0.05, max_depth=6 이렇게 넣어야 score가 높게 나오는 경우입니다 n_estimators=400, learning_rate=0.13, max_depth=10 시험에서도 대중적인 파라미터 대신 평가 점수만 보고 파라미터를 조정해도 괜찮을지 궁금합니다!
강사님 안녕하세요. 강의를 보다가 궁금증이 생겨서요. 49. 다중선형회귀2 (범주형 변수) 에서는 강사님이 스태츠 모델즈의 ols함수에서는 범주형 변수 가 포함되어있으면 이를 자동으로 인식하고 내부적으로 원-핫 인코딩 처리를 하므로 사용자가 별도로 범주형 변수를 수치형으로 변환하는 작업이 없어도 된다고 하셨는데, 52강 이원분산분석에서는 범주형 변수를 분석할때 c()를 사용해 범주형으로 처리해야한다고 하셔서요. 이원분산분석도 ols를 사용하는데 왜 다른지 궁금합니다. 확인 부탁드릴게요!
이론 관련 내용입니다. 독립표본검정 영상에서 1':34'' 위치에 from spicy import stats stats.ttest_ind(A,B) 이 부분을 설명해 주실때 A와 B에 (처리집단, 대조집단)이라고 설명해주시는데요! 어떠한 작업을 처리했다면 처리한 집단을 A에 넣고 그것과 비교할 아무것도 처리하지 않은 집단을 B에 넣는다는 설명은 이해했습니다. 그런데, 그렇다면 대응표본검정과는 어떻게 다른걸까요? 사전/사후 검정과 비슷한 개념 아닌가요?? 학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 문제를 풀다 보면 mean을 쓸 때와 transform('mean') 을 써야하는 상황이 생길텐데 문제에 어떤 부분에서 그런 힌트를 얻을 수 있을까요??
현재 작업형1 문제를 풀고 있는 수강생입니다. 문제 풀이 방식에 궁금함이 있어 저의 풀이 방식을 연습하면서 고쳐나가야하는지 알고싶어 문의 드립니다. 저는 문제 풀 때 df.describe()으로 평균이나 사분위수를 눈으로 보고 해당 값을 직접 작성해서 문제를 풀거나, df.value_counts()로 최빈값을 눈으로 확인해서 푸는 방식으로 문제를 풀고있습니다. 이러한 풀이 방식을 강의 내용처럼 아래와 같은 코드로 푸는 방식으로 개선하면서 공부해나가야하는지 의문이 들어 질문드립니다. df['views'].quantile(.75) freq = df['f3'].mode()[0] 예를 들어 Section13번 문제를 이렇게 풀이하는 방식으로 해도 되는지 궁금합니다. cond = df['f1'].isnull() df = df[cond] df['age'].describe(include = 0) print(round(53.596774,1))
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요. 빈도수 구할 때 value_counts()로 구하신 것 확인했습니다. 하지만 배울때 df.mode()[0]로도 구할 수 있는 것으로 알고있는데 무방할까요?
(AI 퀀트) 바이브 코딩으로 미국 주식 AI 자동 분석 시스템 만들기 with Claude Code
최종 코드 올려주시면 안되실까요? 다 들었는데 따라가기 조금 벅찹니다.. 응용해서 제 투자 스타일에 맞게 수정하려고 하는데, 복습하려고 해도 제 html 과 다른 모양에, 앞 챕터에서 배운 기능이 연동된건지 혼란스럽고 어렵습니다.. 복습+응용할 수 있게 섹션 11 끝난 최종 버젼 코드 올려주시면 감사드리겠습니다..
안녕하세요 '작업형2 문제 제공된 데이터는 성인 인구조사 소득 데이터이다. 제공된 학습용 데이터(train.csv)를 이용하여 소득을 예측하는 모델을 개발하고, 개발한 모델에 기반하여 평가용 데이터(test.csv)에 적용하여 얻은 소득 예측 결과를 아래 [제출 형식] 에 따라 CSV 파일로 생성하는 코드를 제출하시오.' 문제를 강의들으며 열심히 손으로 쓰고 실행하던 중 이상처 처리 중 아래의 코드 실행하니 cond = test['age']<=0 test[cond] 처음에 test.describe()에서 없던 age에서 마이너스값이 나옵니다. 그래서 하나하나 어디서 문제인가 다시 실행을 해보니 (한 코드 실행마다 test.describe() 실행해보며 체크) 결측치 채우기 중 갑자기 test 데이터에서 마이너스가 뜹니다..왜 그런걸까요ㅠ 감사합니다.
안녕하세요. 현재 강의를 수강 중인 수강생입니다. 제 수강기간이 6월 7일까지로, 6월 20일 에 실기시험을 앞두고 있어 시험 전까지 수강이 가능할지 여쭤보고싶어 질문 남겨놓습니다 Q&A 문의 글을 확인해보니, 저와 비슷하게 시험일까지 짧은 기간이 남은 경우 추가결제 등의 별도 방안이 있는 것 같아 문의드립니다. 혹시 시험일까지 남은 짧은 기간 동안 추가 결제를 통해 수강할 수 있는 방법이 있을지 확인부탁드립니다 퇴근후 딴짓 강의 듣고 꼭 합격하겠습니다! 감사합니다 메일주소: jyyp3395@gmail.com
결측치를 대체한 후 해당 컬럼의 평균을 소수점 셋째 자리까지 구하시오라는 문제에 대하여 df[col].mean()을 실행하면 np.float64(25.055) 출력 2. round(df[col].mean(),3)을 실행하면 np.float64(24.794) 출력 print(round(df[col].mean(),3))을 실행하면 25.022라는 값이 나오는데 값이 계속 다르게 나오는 이유를 알고 싶습니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 10:12 에 결과값이 아래와 같은데, (29301, 15) (3257, 15) (29301, 107) (29301, 107) 실제로 실행을 시켜보면 107에서 108로 숫자가 늘어났습니다. (29301, 15) (3257, 15) (29301, 108) (29301, 108) 코랩에 있는 제미나이에게 물어보니 "만약 test 데이터셋에 train 데이터셋에는 없는 새로운 범주가 하나라도 있다면, data_oh 는 그 새로운 범주에 대한 더미 컬럼이 추가로 생기게 됩니다. 따라서 train_oh 보다 data_oh 의 컬럼 수가 많아질 수 있습니다." 라고 나오는데 왜 저는 결과값이 다른걸까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 train_test_split 할때 random_state를 보통 0으로 설정하시는데 이 값을 42를 써도되나요?? [작업형2]연습문제 섹션 6에 0으로 두는거랑 42로 두는거랑 r2 값이 0.2 차이나서 궁금합니다!!