train 데이터에서 id컬럼을 삭제하신 이유가 뭔가요? 이런 비슷한 유형의 문제에서 name이나 host_id같은 결과 값에 영향을 주지 않을 거 같은 컬럼은 삭제해도 무관한가요? 인코딩에서 neighbourhood 컬럼이 train과 test 의 카테고리와 개수가 다 다른데 데이터를 합치지 않아도 되나요? 그럼 concat함수를 꼭 사용해야 하는 경우는 어떤 경우인가요?
작업형 3의 문제 ## 심장마비 확률이 높은사람? - 성별, 나이, 혈압, 콜레스테롤, 공복혈당, 최대 심박수 등의 컬럼이 있음 - 평가: ROC-AUC, 정확도(Accuracy), F1 을 구하시오 - target : output (1:심장마비 확률 높음, 0:심장마비 확률 낮음) - csv파일 생성 : 수험번호.csv (예시 아래 참조) ~~~ 위와 같은 문제가 실제 시험 환경에서 문제 양식과 비슷한가요? 저렇게 문제가 나오면 전처리를 어떻게 해야 하는지... 궁금합니다. 만약, 시험 환경 문제가 저렇게 나온다면.. 결측치 제거를 그냥 컬럼을 보고 아무 컬럼이나 제거를 해도 되는지. 그게 채점 규정에 맞을지. 그리고 결측치 제거시, fillna()를 쓰는데 아무 값이나 넣어도 되는지. fillna(method='bfill') 이런걸 써도 되는지. 이상치 제거도 그냥 이것도 임의로 뭔가 이상치 인거 같다 싶으면 제거 하는건지.. 이게 채점 규정에 맞을지... 애매 한거 같은데요. ============ 그리고 혹시나 시험 유형이 저렇게 안나온다면, 문제를 좀 더 명확하게 서술 해주셔야 할 거 같아요
안녕하세요 혹시 문제에서는 전처리시에 열을 삭제하고, cols = ['name', 'host_name', 'last_review', 'host_id'] 열을 삭제하고, 값이 비어 있는거 train['reviews_per_month'] = train['reviews_per_month'].fillna(0) test['reviews_per_month'] = test['reviews_per_month'].fillna(0) 이렇게 채우는게 문제에서 지시 사항이 없었는데, 작업을 해도 되는건가요? 명확한 지시 사항이 있어야 하는게 아닌가 싶어서 여쭤봅니다. 시험 환경에서 저렇게 데이터를 삭제하거나 이상치를 처리 하는거 결측치 처리를 임의로 해도 되는지 궁금합니다.
from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split( train.drop('Attrition_Flag', axis=1), train['Attrition_Flag'], test_size=0.2, random_state=2022 ) 선생님, 데이터 분리 작성할 떄, train.drop('Attrition_Flag', axis=1) 이 부분이 이해가 가지 않아요. Attrition_Flag 컬럼은 pop함수로 따로 빼놓는거로 알고 있는데, 여기서 왜 drop으로 삭제를 하고, 뒤에 train['Attrition_Flag']를 다시 넣는건지 모르겠어요.. + 데이터 분리 전에, 먼저 target에 Attrition_Flag를 따로 분리시켜놓고 split함수를 작성해도 되나요?
안녕하세요. 다름이 아니라 작업형1 모의문제를 풀고자 데이터를 다운 받았는데 사진과 같이 데이터에 오류가 생기는데 혹시 어떻게 해결할 수 있을까요? 노트북으로 다운 받았는데 오류가 생기길래 폰으로 다운을 받고 노트북으로 옮겼더니 또 오류가 생겼으며 메일을 통하여 다운받아도 똑같이 오류가 나네요ㅠㅠ 혹시 엑셀 버전 차이 때문일까요?
안녕하세요, 선생님. 강의 잘 듣고 있는 재직자입니다. 저번 시험부터 준비하려고 했지만, 프로젝트가 겹쳐서 마지막 시험인 이번 회차까지 넘어오게 되었네요... 수강 기간이 11월 1일까지인데, 혹시 이번 시험인 11월 말까지만 강의 연장이 가능한지 여쭤보고 싶습니다. 마지막 기회인만큼 정말 열심히 하겠습니다..! 답변 기다리고 있겠습니다. 감사합니다! 제 이메일은 ( areuwho112@gmail.com ) 입니다!
안녕하세요? 결측치를 처리할때 평가지표 결과를 통해 점수가 높은 방법으로 결측치를 처리하는게 좋다고 하셨는데 만약 train에 결측치가 포함된 컬럼이 3개일때 각각 컬럼마다 다양한 방법의 결측치 처리방법을 적용하여 결과값을 비교하면서 최적값을 찾아야하는지, 아니면 결측치가 있는 컬럼 3개에 대해서는 한가지 방법의 결측치 처리방법을 적용해도 되는지 궁금합니다. 컬럼이 3개일때 각 컬럼마다 여러가지 결측치 처리방법을 적용하면서 비교하면 경우의 수가 많을것같아 질문드립니다.
안녕하세요, 선생님. 강의 잘 듣고 있는 취준생입니다. 저번 시험부터 준비하려고 했지만, 갑작스럽게 인턴에 합격하게 되어 이번 회차까지 넘어오게 되었습니다... 수강 기간이 10월 31일까지인데, 혹시 이번 시험인 11월 말까지만 강의 연장이 가능할까요? 가능하다면 정말 열심히 하겠습니다...! 답변 기다리고 있겠습니다. 감사합니다! 제 이메일은 ( okhye14126@naver.com ) 입니다!
df['subscribed']= pd.to_datetime(df['subscribed']) df['subscribed']= df['subscribed'].dt.to_period('M') cond= df['subscribed'] == '2024-02' df= df[cond] #print(df) result= df['f3'] =='gold' print(len(result)) 풀이와 다르게 이렇게 입력하면 답이 10이 나옵니다. 중간에 df 확인해 보면 f3에 골드가 5개가 들어가 있는데 마지막 결과 인출에서는 왜 10이 나올까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 f1 score 지표가 나오면 어떤 경우의 수가 있는지 잘 모르겠어요.. 문제에서 f1 score macro 지표로? 나오면 f1_score(y_val, pred, average='macro') 이고 pos_label은 또 다른 경우인거지요..? 그 외에는 어떤 것들이 있나요? 반드시 암기해야할 지표인데, f1_score도 한가지로 정해진건 아닌것 같아서요.. 시간이 부족한 비전공자라서 작업형 2 한 방법으로 풀기로 연습 중입니다..도와주세요 선생님!!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선생님, 시험 시, 테스트 케이스 탭을 사용할 필요는 없을까요? 실행결과, 제출 결과 탭만 의미있는 탭인지요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 pd.set_option('display.max_columns', None)은 작업형1, 2 에서 주로 사용하면 될까요? 필수일까요..?