문제 2번에서 isnull() 로 결측치를 계산해 보니 f1 컬럼이 결측치가 30% 이상이었습니다. 이때 결측치가 30% 이상인 컬럼을 df.columns[...] 로 변수에 저장해서 사용하는 것보다, 컬럼 이름 f1 을 직접 코드에 넣는 방식이 더 적절한 건가요? 실무에서는 어떤 방식이 더 많이 쓰이는지도 궁금합니다.
안녕하세요. train과 test object 유형 또는 갯수가 다르게 되면 어떤 처리가 필요한가요? train.describe(include=object), test.describe(include=object) 프린트해서 보면 개수가 같은지 보고 있는데요. 1.다른 경우는 어떻게 해야하는지, 2.아니면 범주 자체가 다른데 갯수만 똑같으면 상관없는지 궁금합니다.
위에가 영상 속 코드고 밑에가 제가 작성한 코드 인데 영상 속 코드 처럼 안하고 제가 작성한 대로 해도 괜찮은가요? target = train.pop('price') from sklearn.model_selection import train_test_split X_tr,X_val,y_tr,y_val = train_test_split(train,target,test_size=0.2, random_state=0)
안녕하세요 질문 있습니다! 함수 정의시 예를들어 def maxmin(data): 라고 정의를 할 떄, 소괄호안 data 에는 아무 값이나 들어가도 되는건가요? maxmin() 일때는 함수 실행이 안되고 maxmin(x) 또는 maxmin(y) 등을 쓰면 실행은 되던데... 소괄호 안에 들어 갈 수 있는 변수의 범위가 궁금합니다.
몇가지 학습에 있어 궁금함이 생겨 질문드립니다. 1) 작업형 제1유형에서 사진과 같이 짤리는데 방법이 없을까요? 시험 환경도 동일 하더 라구요 2) 작업형 1유형에서 문제3을 푸는데 선생님이 푼거랑 다르게 풀어서 문제 답 내도 상관없나요? 3) 작업형 2유형에서 만약 MAE를 안돌리고 답안제출한다면 y_val은 필요가 없는건지 궁금합니다^^
안녕하십니까 from sklearn.metrics import f1_score f1 = f1_score(y_true_str, y_pred_str, pos_label='A') 문자일때, pos_label = "A" (A:양성값 1)로 입력이 필요하다고 하셨는데, 여기 양성값(1)에는 어떤 값을 넣어야 하는걸까요? target을 넣으면 될까요 ?
검증데이터 분할을 할 때 왜 gender를 drop하나요? from sklearn.model_selection import train_test_split X_train,X_val,y_train,y_val =train_test_split( train.drop('gender',axis=1),train['gender'] ,test_size=0.2,random_state=0) print(X_train.shape,X_val.shape,y_train.shape,y_val.shape)
pred 컬럼 명이 0또는1이 아니라 문자일 때 컬럼을 선택해주기 위해서 pos_label을 사용해준다고 하셨는데 모든 평가지표에서 pos_label을 사용해야 하는지와 pos_label을 써서 컬럼을 선택해줬는데, 실제 값을 예측할 때 {'pred':pred[:,1]}을 해주는게 맞는지 궁금합니다 이미 한 컬럼이 선택됐는데 범위를 지정할 경우 이상이 없을까요?
혼자 드디어 처음으로 외워서 작성해본 2유형코드입니다~ 평가점수가 저정도 나오는데 아무래도 수치형을 스케일링하지않아서 일까요? 아니면 원핫인코딩이 더 적절한거였을까요? 아니면 저정도 점수여도 안전한 구역일까요? import pandas as pd train=pd.read_csv("train.csv") test=pd.read_csv("test.csv") print(train.shape) print(test.shape) train.info() cols=train.select_dtypes(include="O").columns cols from sklearn.preprocessing import LabelEncoder le = LabelEncoder() for col in cols: train[col] = le.fit_transform(train[col]) test[col] = le.transform(test[col]) target=train.pop("TravelInsurance") #데이터분할하기 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=2022) from sklearn.ensemble import RandomForestClassifier model = RandomForestClassifier() model.fit(X_tr,y_tr) pred=model.predict_proba(X_val) from sklearn.metrics import roc_auc_score print(roc_auc_score(y_val,pred[:,1])) #0.7486363636363635
Broken DAG: [/opt/airflow/dags/dags_bash_ operator.py ] Traceback (most recent call last): File "<frozen importlib._bootstrap_external>", line 1063, in source_to_code File "<frozen importlib._bootstrap>", line 488, in call with_frames_removed File "/opt/airflow/dags/dags_bash_ operator.py ", line 24 bash_t1 >> bash_t2 ^ IndentationError: unindent does not match any outer indentation level 이런 에러가 났는데요 소스에서 확인해보니 from airflow.operators.bash import BashOperator ㅇ airflow.operators.bash 에 ~~~~~~ 이렇게 되어 있네요. 강사님 따라 그대로 했는데 에러가 왜 난걸까요?
강의 정말 잘 듣고있습니다. DFS 너무 어려웠는데 저에게 한 줄기 빛 같은 존재십니다..! 원본 문제가 바뀐것같기도 한데, 13565번 백준 원본을 보면 M, N 순서대로 입력을 받는 것 같습니다. M이 행에 해당되고, N이 열에 해당이 되어서 전반적으로 반대가 되어야하고, 강의에서 말씀 주신 이 부분도 def dfs (y, x): global visited, map_, answer, N if y == N: answer = True return y == M 으로 바뀌어야할 것 같은데 맞을까요?