학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 제미나이 같은 곳에 물어봐도 뭔가 명확한 답을 못 찾겠어서 질문합니다. EDA 결측치 삭제 또는 채우기 train y값 pop 수치형 데이터 스케일링 범주형 데이터 인코딩 데이터분할 머신러닝 학습 및 평가 테스트 값 도출 및 파일 생성 이러한 과정에서 pop 하는 타이밍, 결측치 처리, 스케일링, 인코딩, 데이터 분할을 어떻게 해야 하는지 순서가 감이 안 옵니다. 과정이 꼬이면 y값 데이터에 영향을 줄까봐 걱정돼서요.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요! 유형2 검증까지 다 완료하고 모델 확정하고 나서 80퍼센트만 학습한 상태이니 정확도 올리고 싶어 100퍼센트 다시 학습시키 고 test 검증해서 최종제출해도 되나요? 파일이미지 확인 부탁드려요!
QML더 깊게 강의를 듣고 싶은데 [초급] 중급자로 도약하기 위한 Qt/QML 실전프로그래밍, [초급] QML 프로그래밍 2편 강의들이 C++ 를 해야 듣을수 있을가요? 제게 69년생 노땅인데 Python 말고 또 다른언어를 공부하기가 좀 부담되고 ㅎㅎ, 어떻게 하는게 맞을가요? 도움 부탁드립니다
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 기출문제를 풀어보면 대부분 train, test로 데이터가 제공되어있는데, 실제 시험에서도 보통 이렇게 주는건가요? X_train, X_test, y_train 이렇게 나눠서 주는게 보통의 경우인건지 아님 train, test로 주는게 보통인건지 궁금합니다!
두 집단의 로그 리지스틴 값에 대한 합동 분산 추정량을 구하기 위에서 아래의 코드로 푸는 풀이가 알맞는지 질문드립니다.(혹은 우연의 일치로 해당 값이 나온건지 궁금합니다.) 꼬리질문 2에서 두 집단이라고 출제되었기에 df를 나누지않고, 로그 리지스틴 값이라고 명시되어 로그 리지스틴을 기준으로 구하는 것이기에 리지스틴에 로그를 취한 것을 종속변수로 설정해 풀었습니다. import pandas as pd import numpy as np df = pd.read_csv("data/bcc.csv") # 사용자 코딩 from statsmodels.formula.api import ols from statsmodels.stats.anova import anova_lm model = ols('np.log(Resistin) ~ C(Classification)', data=df).fit() print(anova_lm(model)) 출력 결과 (분산은 잔차들의 제곱의 평균이니까) 이렇게 출력된 결과 Residual(잔차)의 mean_sq의 값을 두 집단의 로그 리지스틴 값에 대한 분산이라고 생각해도 되는건가요?
안녕하세요~ 작업형 2 분류와 회귀 강의를 학습하는 도중 질문이 있습니다! 분류에서는 제출 파일은 예측값만 result.csv 파일로 생성해 제출(컬럼명: pred, 1개) 회귀에서는 제출 파일은 예측값만 포함된 result.csv 로 생성 (컬럼명: pred , 1개) 분류 강의에서는 생성해 제출이라고 하셨고, 회귀 강의에서는 생성이라고 하셨는데 분류와 회귀 강의에서 한 작업에서 다른 점이 없는 거 같아서 질문드립니다. (데이터프레임 만들어서 제출하되 read로 행 개수 확인하기) 정확히 어떤 차이가 있는 걸까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 인코딩과 스케일링 순서가 궁금합니다. 인코딩 하고 스케일링 하면 문자형들이 이미 숫자로 바껴서 스케일링 먼저 하고 인코딩이 낫나요? 라벨 인코딩 하면 0~1보다 더 큰 숫자여서 라벨 인코딩 한 것 자체도 스케일링 될 거 같은데 괜찮은지 모르겠습니다.