OLS 모델을 적합하는 라이브러리 임포트를 아래와 같이 알고 있는데요. statsmodels.formula. api import ols 선생님께서는 statsmodels.formula. api import smf로 쓰셨는데 동일한 기능인건가요? formula를 만드실 때에도 아래와 같이 쓰셨는데요. model_refit = smf.ols('y ~ x1 + x2 + x3', data=data).fit() ols와 smf 같이 쓰지 않아도 학습이 잘되긴 해서 저는 ols로만 학습시키고 있는데 smf는 어떤 기능이 있는지 궁금합니다.
상관관계 값이 가장 큰값에 대한 질문입니다. 값을 찾을 때 독립변수(x1~x4)만을 비교하여 값을 찾으면 될까요? 아니면 종속변수( y)를 포함하여 가장 큰 값을 찾으면 될까요? 처음에는 0.822594 이라고 생각했는데 문제에서 x변수들간의 상관관계를 물어보는 것 같아 -0.224881라 생각하는데... 가장 큰 값에 대하여 헷갈리네요^^:
안녕하세요. 강의 제공자입니다. 이 강의에서 사용하는 파이썬 프로그램은 구글 콜랩에서 수행을 해야 합니다. 개인 구글 계정이 있으면 되고요. 파이썬 프로그램에서 사용하는 데이터 파일은 프로그램 코드((ipynb 확장자)에서 자동으로 다운로드 받도록 되어 있습니다. 코드를 실행하면서 확인하실 수가 있어요. 가끔 데이터 파일이 없다고 문의를 하시는 분들이 있어서 메세지를 남겨드립니다. 그럼, 참고하시고요. 항상 좋은 일들이 가득하시길 빌겠습니다. 행복한 날들 보내십시오. 감사합니다.
안녕하세요 선생님, 결측치 처리하면서 train과 test에 모두 동일한 컬럼에 대해 결측치가 있는 행을 삭제하였는데요(name, host_name). 나중에 시험에서 이렇게 제출해도 채점하는데 문제가 없나해서요. 선생님께서 주신 y_test를 토대로 r2_score(y_test, pred))를 채점해보면 데이터 행의 수가 달라서 오류가 나더라구요. 혹시 시험에서도 이렇게 오류가 나서 채점이 안되지는 않는지 궁금합니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 시험환경에서 df 전체가 보이지 않기때문에 초기 설정 값을 해야한다고 강의에서 보았는데요, 9회 실시에서도 적용이 필요한지 궁금하며, 입력코드가 알고싶습니다.
안녕하세요~ 기출문제 강의 영상을 보면 작업형 2에서 범주형 데이터는 인코딩을 하고, 수치형 데이터는 따로 정규화 작업을 수행하지 않는 경우가 있습니다. 수치형 데이터의 경우 정규화를 안해도 결과값에 큰 영향을 주지는 않나요? 수치형데이터를 정규화 하는 경우 아래의 방법이 맞는지도 질문드립니다. 감사합니다. #수치형, 범주형 구분 n_train = train.select _dtypes(exclude='object') n_test = test.select _dtypes(exclude='object') c_train = train.select _dtypes(include='object') c_test = test.select _dtypes(include='object') # 수치형데이터 정규화 from sklearn.preprocessing import StandardScaler scaler = StandardScaler() cols = train.select _dtypes(exclude='object').columns n_train[cols] = scaler.fit _transform(n_train[cols]) n_test[cols] = scaler.transform(n_test[cols]) # 합치기 train = pd.concat([n_train, c_train], axis=1) test = pd.concat([n_test, c_test], axis=1)
로지스틱회귀문제를 구할때는 formula = "Churn ~ DataUsage + DayMins" 위와 같이 formula를 따로 적어줬는데 다중선형회귀분석에서는 formula를 따로 위에 적지 않고 model = ols('PIQ ~ Brain + Height + Weight', data=df).fit() 이렇게 풀이가 된 이유가 뭘까용??
기출에서 쓰신 Encoder가 RobustEncoder, 원핫인코더, LabelEncoder가 있는데 분류, 회귀 문제 구분없이 아무것이나 쓰면 되는 것인가요? 3 인코더를 구분해서 써야하는 특징이 있나요? 시험환경 테스트에서 단축키(실행) Alt+Enter가 되지 않는데 실제로도 그런 것인가요? 시험장 환경에서 실행버튼 클릭 외 단축키가 있는 지 궁금합니다. 감사합니다.
안녕하세요, 질문이있습니다. 예를들어 유형1 같은경우 어떤 값이 무엇이냐? 소수점 3자리까지 구하라 이렇게 제시가되는데요 이과정에서 저의 코드는 어떤 코드로 진행하는것이 아닌 제가 그냥 df.head()를 통해 보고 그값을 눈으로 찾아 그걸 이용해도 상관없는지, 또 답을 제출할때도 표를 보고나서 그냥 제 눈으로 찾아서 혹은 제스스로 반올림을 직접해서 답을 제출해도 되는지 궁금합니다.
데이터 전처리에서 test_id의 데이터가 9779개이고, 검증 데이터 분리에서 X_val의 데이터가 5868개입니다. 행의 개수가 맞지 않아서 오류가 발생하는데, 어떻게 해결해야 할까요? 'id' 컬럼을 pop 하고, 검증 데이터를 분리하면 아래와 같이 행 수가 줄어듭니다. 그리고 랜덤 포레스트로 pred를 예측하는데요. X_val 값이 들어가는 게 아닌가요?