1유형 : 내주신 문제39개중에 20번대 후반 이후로 잘 못푸는 상태(datetime부분이 약함) 2유형 : 40점 만점 가정 3유형 : 분산분석 제외 summary에서 찾는것 모두 가능 (카이제곱, 독립성, logit, ols) 이 상태인데 남은 4일동안 1유형을 보강할지, 분산분석을 알아갈지 고민인데 어떻게 생각하시나요..?
eda 진행하여 object인 컬럼들 모두 라벨인코딩 진행한 후, X_train=X_train.drop(columns=['ID']) X_testID = X_test.pop('ID') from sklearn.ensemble import RandomForestClassifier model = RandomForestClassifier(random_state=2022) model.fit(X_train,y_train) pred = model.predict_prova(X_test) 진행하였는데 모델 학습 돌리는 과정중에 계속 런타임이 빙글빙글 돌아가면서 학습이 되지않습니다 왜 그런걸까요..? ㅠㅠㅠ
작업형 2에서 pred를 그냥 쓰는게 아니라 pred[:,1]를 쓸때 이해가 안가서 그냥 이대로 암기했었습니다. 이걸 쓰는 이유를 정확히 알고 싶은데 roc_auc는 양수의 확률 값을 예측한걸 평가하는 것이고, 나머지 분류지표는 0또는 1을 예측한걸 평가하는 지표이기 때문에 roc_auc경우에만 양수인 컬럼을 따로 지정하기위해 pred[:,1]를 사용하는 것이 맞을까요? 그렇다면 roc_auc일때만 pred[:,1]이렇게 따로 지정해주면 될까요?
test_id = test.pop('id') 이렇게 따로 빼두는 이유가 저장할때 id컬럼을 생성하기 위해서라면, 굳이 pop함수로 빼지 않고 저장할때 직접적으로 pd.DataFarme({'id':test['id'], 'y_pred':pred}) 이렇게 test['id']로 적으면 안되는 걸까요?
안녕하세요. 섹션5-27 강의 수강 중 입니다. 인코딩 파트의 가장 윗 부분 코드와 관련하여 y_train = train.pop("income") 단독 실행 시 KeyError 에러가 발생합니다. 다만, 상단의 모두 실행으로 실행 시 정상 작동 됩니다. 에러 메시지에서도 '위의 예외는 다음 예외의 직접적인 원인이었습니다.' 라고만 표시되어 어떻게 조치를 취해야 하는지 감이 잘 오지 않습니다ㅠㅠ + 상단의 데이터 불러오기에서 데이터를 확인했을 때 income 컬럼이 있는 것 확인했습니다. + 바로 아래의 원핫인코딩 코드에 커서를 놓고 런타임-이전 셀 실행 으로 실행하니까 이때는 또 정상 작동을 하네요?
2유형에서 원핫인코딩이나 레이블 인코딩 후에 민맥스나 스탠다드 스켈링을 하는데요 스케일링할 때 범주형 데이터를 제외하는 작업을 하지 않고 그냥 통으로 train과 test 스케일링을 하고 있거든요. 혼자 공부하니까 제대로 하고 있는지 의문이 되네요 그냥 통으로 스케일링 해도 결과값에 영향이 없나요? from sklearn.preprocessing import MinMaxScaler, StandardScaler sc = MinMaxScaler() train = ms.fit_transform(train) test = ms.transform(test)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선생님, 아래 두 코드 중 하나를 쓰면 될까요? 두 코드는 똑같은 의미인가요? 해당 문제로 적용했을 때, 같은 값이 나오긴 합니다만,, 현재 강의에서는 첫번째 코드 [작업형3] 9. 로지스틱 회귀 에는 두번째 두 줄짜리 코드로 적혀있어서 둘 중 하나로 외워두면 될지 궁금합니다.(임계값이 따로 나오지않으면 >0.5 를 적용하는것으로 전제하에..) pred = model.predict(test) > 0.5 pred = model.predict(test) pred = (pred > 0.5).astype(int)
이번 예시문제에서 train ,test를 26번째 줄 처럼 align 해주지 않으면 '주구매상품_소형가전'이 train에서만 존재해서 에러가 발생하는데 이번에 처음보는 에러라서 GPT가 저 줄을 추가하라고 알려줘서 알게 됐는데, 원래 원핫인코딩에는 저런 align을 외워둬야할까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 실제시험에서 제가 선생님처럼 데이터전처리하면서 커스터머아이디를 드랍할 여유가 없을것같은데 그냥 타겟에다가 팝만 하면 안될까요? 그러면 아예 오답이 돼버릴까요?
강의에서 '데이터 전처리2(인코딩, 스케일링)' 부분 중 인코딩 부분에 대해 질문드립니다. 영상 중 7분 50초 쯤에 심화 내용으로 train, test 데이터를 concat으로 합쳐서 원핫 인코딩을 하는 방법이 있다고 하셨습니다. 그런데 학습 과정에 이 합쳐진 데이터를 넣어서 해도 되는건가요? test 데이터를 모델에 넣어서 학습시키는게 맞는건지 헷갈려서 질문드립니다.
안녕하세요. 49강 수강 중 질문이 있습니다. for table_name in TABLES.keys(): extract_from_postgres(postgres_schema, table_name) >> load_to_snowflake(snowflake_schema, table_name) 현재 강사님이 주신 이 코드 기준 테이블 2개 tasks 2개 해서 총 4개의 tasks가 airflow tasks list의 결과로 반환되었는데요, 이때의 결과물인 tasks_id가 어떻게 만들어지는지 궁금합니다. 조금 더 정확히는 forloop으로 task를 정의할 때 어떤 식으로 DAG가 이 task의 개수를 세고 네이밍을 하는지 궁금합니다. 혼자 테스트를 해보고 싶어서 임의의 테이블 하나를 postgres:production에 추가하고 코드내부의 TABLES 딕셔너리에 제가 추가한 테이블의 스키마를 추가하였습니다. 이때 테이블이 총 3개가 되었으므로 airflow tasks list의 결과가 총 6개가 될 것으로 예상하였는데 여전히 4개로 나옵니다. 제가 놓친 부분이 있을까요? 현재 production schema아래 3개의 테이블이 있는 상태입니다. airflow=# SELECT table_name FROM information_schema.tables WHERE table_schema = 'production' AND table_type = 'BASE TABLE' ORDER BY table_name; table_name ------------------------ session_timestamp user_session_channel user_session_channel_2 (3 rows) 감사합니다. 학습 관련 질문을 상세하게 남겨주시면 더 좋습니다. 예를 들어 이해가 안 가는 부분이 있다고 하면 강의에서 어느 부분인지 어떤 부분이 이해가 안되는지 등등 추가 정보가 큰 도움이 됩니다. 그리고 에러가 난다면 어떤 에러 메시지가 나오는지 같이 공유해주세요. 혹시라도 유사한 질문이 있었는지 먼저 확인 부탁 드리겠습니다. 서로 예의를 지키며 존중하는 문화를 만들어갔으면 하고 인프런 서비스 운영 관련 문의는 1:1 문의하기를 이용해주세요.
안녕하세요 시간이 별로 남지 않아 일단 강의만 후루루룩 본 상태라 이제 중요사항만 다시 반복하려고 합니다ㅠ pd.set_option('display.float_format, '{:.10f}.format() 제 기억엔..이거랑 하나 더 있었던 것 같은데 외우라고 하셨는데ㅠ 강의를 일단 후루룩 본 상태라서ㅠ 어디 강의에서 말씀하셨는지 기억이 잘 안나네요ㅠ (혹시 알 수 있을까요..) 그리고 저 코드랑 비슷한거 하나 더 해서 외우라고 하셨는데.. 그 나머지 하나랑.... 저게 어떤 상황에서 쓰는 코드인지 다시 질문드립니다 데이터가 저런 식으로도 자주 나오는지도 궁금합니다! 좋은 강의 항상 감사드립니다!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 기출7회 작업형 3 강의 때는 accuracy_score 구할 때, target = test.pop('gender')을 하는 단계가 있었는데요, (아래코드) from sklearn.metrics import accuracy_score from statsmodels.formula.api import logit # 데이터셋 분할 train = df.iloc [: 210 ] test = df.iloc [ 210 :] # 1) 학습, test데이터를 사용해 예측 (0.5 미만: 0, 0.5 이상 1) model = logit ( "gender ~ weight" , data=train ) .fit () target = test.pop ( "gender" ) pred = model.predict ( test ) > 0.5 # 2) 실제 값과 예측 값을 사용하여 정확도 계산 acc = accuracy_score ( target , pred ) # 3) 오류율 계산 print ( round ( 1 -acc , 3 )) 지금 예시문제에서는 따로 없어서 작업형 3에서는 어떨 때 target = test.pop('gender') 를 해야하는지 궁금해요.