안녕하세요 강사님! 하이퍼 파라미터 튜닝 시 궁금한게 있어서 질문드립니다! train_test_split() 으로 데이터를 분리해서 모델 성능을 검증할 때, 하이퍼 파라미터 중 max_depth 값을 1을 줬을 때 검증에서는 성능이 제일 좋게 나오는 경우 1 값 그대로 줘도 괜찮나요?? 뭔가 max_depth=1 은 실제 값을 예측 할 때 좀 위험(?)하지 않을까 하는 의문이 들어서 질문드립니다!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 예시문제 작업형2에서 원핫인코딩(pd.get_dummies)를 하고 작업형 2 한가지 방법으로 문제 풀기를 하면 오류가 발생합니다 train과 test의 object인 주구매상품의 유니크 수가 달라서 그런간가요? 유니크 수가 다른 경우 그 컬럼만 삭제하고 작업형2 한가지 방법으로 풀기와 동일한 흐름으로 문제를 풀어도 될까요? (아래 첨부한 코드처럼요!) train = train.drop(['주구매상품'], axis=1) test = test.drop(['주구매상품'], axis=1) print(train.shape, test.shape) train = pd.get_dummies(train) test = pd.get_dummies(test) print(train.shape, test.shape)
위 문제에서, 독립변수로 income, 종속변수로 purchase 를 사용해 logit 로지스틱 회귀 모델을 만들어 학습하고나서, 예측을 할 때, test 의 test["income"] 을 predict( ) 함수 안에 넣어야 하는거 아닌가요? 캐글 풀이에서는 test 전체를 넣어서 혼란이 옵니다. 그리고 이 문제에서 모델의 유의확률을 구하라고 했는데요. 특정 독립변수의 PVALUE 가 아니라 모델의 P VALUE 이므로 위 model.summary() 에서 오른쪽 아래 쯤에 있는 LLR p-value 아닌가요? 이 문제에서는 단순선형회귀라서 독립변수 income 의 p value와 LLR-P value 가 같긴 합니다만, 만약 독립변수가 여러 개 이고, 모델의 pvalue를 구하라고 하면 LLR- P VALUE 가 맞을까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 test데이터 예측할 때, train데이터를 훈련용과 검증용데이터로 분할해서 모델 검증하고 train데이터 전체로 모델 다시 학습해서 test데이터 예측하는 걸로 알고 있는데 다른 예시들 보니까 train데이터 분할해서 만든 모델로 그대로 test데이터 예측하시던데 상관 없나요?
타겟값이 범주형일 때, 라벨인코딩 하기 전에 target=train.pop()을 통해서 타겟컬럼만 따로 빼주셨는데 train.drop('Heat_Load',axis=1).select_dtypes(include='O').columns 을 이용하여 컬럼값을 변수에 저장해놓고 라벨인코딩을 하는 것도 상관없는지 궁금하여 여쭈어봅니다 !!
안녕하세요, 강사님. 확인차 질문 드립니다. 작업형2에서 문제를 풀고 해당 코드까지 실행하여 result.csv가 잘 생성된 것을 확인했다면, pd.DataFrame({'pred': pred}).to_csv('result.csv', index=False) print ( pd.read _csv('result.csv')) 여기에서 바로 '제출' 버튼만 누르면 result.csv의 제출이 완료되는게 맞는건가요?
# 작업형3 # 문제1. 주어진 조개 데이터 300개 중 앞에서부터 210개는 train 데이터로 만들고, 나머지 90개는 test데이터로 만든다. # 모델을 학습(적합)할 때는 train데이터를 사용하고, 예측할 때는 test데이터를 사용한다. # 모델은 로지스틱 회귀를 써서 성별(gender)을 예측하되, 패널티는 부과하지 않는다. # 문제1-1. weight를 독립변수로 gender를 종속변수로 사용하여 로지스틱 회귀 모형을 만들고, # weight 변수가 한 단위 증가할 때 수컷일 오즈비 값은? (반올림하여 소수 넷째자리까지 계산) 이 문제에서 패널티는 부과하지 않는다. --> 만약 패널티를 " 부과하라 "는 문제가 나오면 어떤 공식을 추가해야 하나요? 수컷일 오즈비 값은? --> " 암컷 "일 오즈비 값은? 이라는 문제가 나오면 어떻게 해야 하나요? 1에서 오즈비 값을 빼면 되나요?
airflow와 postgres 간의 connection 오류 문제입니다. airflow UI -> admin-> connections에서 postgres 연결설정 docker-compose.yaml 설정 dag 코드 입력 airflow tasks test postgres_loader execute_sql_query 2023-01-01 시에 오류가 뜹니다ㅠ [2024-06-21T15:40:45.514+0900] { dagbag.py:545 } INFO - Filling up the DagBag from /home/kim/airflow/dags [2024-06-21T15:40:45.805+0900] { taskinstance.py:2076 } INFO - Dependencies all met for dep_context=non-requeueable deps ti=<TaskInstance: postgres_loader.execute_sql_query __airflow_temporary_run_2024-06-21T06:40:45.755970+00:00__ [None]> [2024-06-21T15:40:45.811+0900] { taskinstance.py:2076 } INFO - Dependencies all met for dep_context=requeueable deps ti=<TaskInstance: postgres_loader.execute_sql_query __airflow_temporary_run_2024-06-21T06:40:45.755970+00:00__ [None]> [2024-06-21T15:40:45.812+0900] { taskinstance.py:2306 } INFO - Starting attempt 1 of 1 [2024-06-21T15:40:45.812+0900] { taskinstance.py:2388 } WARNING - cannot record queued_duration for task execute_sql_query because previous state change time has not been saved [2024-06-21T15:40:45.813+0900] { taskinstance.py:2330 } INFO - Executing <Task(PostgresOperator): execute_sql_query> on 2023-01-01 00:00:00+00:00 [2024-06-21T15:40:45.855+0900] { taskinstance.py:2648 } INFO - Exporting env vars: AIRFLOW_CTX_DAG_OWNER='airflow' AIRFLOW_CTX_DAG_ID='postgres_loader' AIRFLOW_CTX_TASK_ID='execute_sql_query' AIRFLOW_CTX_EXECUTION_DATE='2023-01-01T00:00:00+00:00' AIRFLOW_CTX_TRY_NUMBER='1' AIRFLOW_CTX_DAG_RUN_ID='__airflow_temporary_run_2024-06-21T06:40:45.755970+00:00__' [2024-06-21T15:40:45.858+0900] { taskinstance.py:430 } INFO - ::endgroup:: [2024-06-21T15:40:45.870+0900] { sql.py:276 } INFO - Executing: INSERT INTO sample_table (key, value) VALUES ('hello', 'world') [2024-06-21T15:40:45.875+0900] { taskinstance.py:441 } INFO - ::group::Post task execution logs [2024-06-21T15:40:45.875+0900] { taskinstance.py:2905 } ERROR - Task failed with exception Traceback (most recent call last): File "/home/kim/.local/lib/python3.10/site-packages/airflow/models/ taskinstance.py ", line 465, in _execute_task result = _execute_callable(context=context, **execute_callable_kwargs) File "/home/kim/.local/lib/python3.10/site-packages/airflow/models/ taskinstance.py ", line 432, in _execute_callable return execute_callable(context=context, **execute_callable_kwargs) File "/home/kim/.local/lib/python3.10/site-packages/airflow/models/ baseoperator.py ", line 401, in wrapper return func(self, *args, **kwargs) File "/home/kim/.local/lib/python3.10/site-packages/airflow/providers/common/sql/operators/ sql.py ", line 277, in execute hook = self.get_db_hook() File "/home/kim/.local/lib/python3.10/site-packages/airflow/providers/common/sql/operators/ sql.py ", line 188, in get_db_hook return self._hook File "/usr/lib/python3.10/ functools.py ", line 981, in __get__ val = self.func(instance) File "/home/kim/.local/lib/python3.10/site-packages/airflow/providers/common/sql/operators/ sql.py ", line 150, in _hook conn = BaseHook.get_connection(conn_id) File "/home/kim/.local/lib/python3.10/site-packages/airflow/hooks/ base.py ", line 83, in get_connection conn = Connection.get_connection_from_secrets(conn_id) File "/home/kim/.local/lib/python3.10/site-packages/airflow/models/ connection.py ", line 519, in get_connection_from_secrets raise AirflowNotFoundException(f"The conn_id `{conn_id}` isn't defined") airflow.exceptions.AirflowNotFoundException: The conn_id `my_postgres_connection` isn't defined
안녕하세요. 좋은 강의 잘 듣고 있습니다. 강사님께서 RMSE를 만들 때 함수를 만들어서 사용하시는데mean_square_error를 불러온 다음mean_squared_error(squared=False)를 하면 RMSE가 되는 것으로 알고 있습니다.굳이 함수를 만드는 것보다 더욱 쉬울 것 같은데 함수를 만들어 사용하시는 이유가 궁금합니다. 좋은 강의 감사합니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요! 이전에 random forest classifier에서는 n_estimators랑 max_depth로 파라미터 튜닝이 가능하다고 말씀해 주셨는데요. 제 기억에 분류 모델에서만 적용이 가능했던 것 같은데 Random forest regression에서도 적용해도 되는 걸까요? rf = RandomForestRegressor(random_state=0, n_estimators = 500, max_depth = 5) 이렇게요..! 그리고 각 파라미터의 적정 range가 어느 정도인지도 궁금합니다.