학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 # 레이블 인코딩, 랜덤포레스트: 807.8000397227841 # 원핫 인코딩, 랜덤포레스트: 819.45688399024339 # 레이블 인코딩, lgb: 779.846084731424 # 원핫 인코딩, lgb: 786.6443289033147 # 모델은 lgb로 선택 # 모델 선택 후 튜닝, 결측치 처리 유무, 인코딩 유무 확인하며 성능 비교하기 # 튜닝 X -> 더 높아짐 # 결측치 0으로 처리, 카테고리로 인코딩: 772.4958384891883 # 결측치 처리 X, 카테고리 인코딩: 768.6458172187305 # 결측치 처리 X, 레이블 인코딩: 782.66052200386 # 결측치 0으로 처리, 레이블 인코딩: 779.8460847311424 위의 과정을 거쳐 lgb모델, 결측치 처리 X, 카테고리 인코딩으로 선택하여 진행하였는데, 이렇게 하는 것이 맞는지 확인차 질문드립니다 !!! 그리고, 다 선택 후, train, target 전체 데이터로 재학습 후 test 예측하는 것이 더 좋을지 질문드립니다 !
안녕하세요, train 데이터에는 없지만 test 데이터에는 있는 범주형 데이터를 인코딩하기 위해서 train test를 다 합친 후에 인코딩을 수행하는 것으로 알고 있는데요, (라벨인코딩, 원핫인코딩) 만약 train test 두 데이터를 합친 데이터를 fit 하고 train, test 별로 transform 하면 이것도 결국엔 Data Leakage가 되는 것이 아닌지 여쭙고 싶습니다. 만약 시험 환경에서 저런 상황이 나타난다면 Data Leakage는 감수하고 인코딩을 수행해야 하는 것인지 궁금합니다. 감사합니다.
작업형 2를 풀때 회귀문제에서 카테고리가 다른 경우는 기출에서는 나오지 않았고 연습문제에서만 나왔는데 지금까지 카테고리가 같은 것만 공부해서 카테고리가 다른 경우는 공부하지 않았습니다 카테고리가 다른 경우가 나올 확률이 높아서 공부하는게 좋을지 시험3일 전에 여쭤봅니다..!
안녕하세요, XGBRegressor 학습 시 나타나는 warning으로 실제 오류와 자주 헷갈려서, import warnings warnings.filterwarnings('ignore') 실행 후 코드를 계속 실행해도 괜찮을 지 여쭤보고자 문의 드립니다. 좋은 강의 감사합니다.
'views' 컬럼의 1사분위수, 3사분위수 그리고 IQR을 계산하시오. 이상치 조건에 맞는 데이터를 찾으시오. (이상치는 1사분위수 – (IQR 1.5)보다 작은 값과 3사분위수 + (IQR 1.5)보다 큰 값) 이상치 데이터의 'views' 컬럼 합을 정수로 구하시오. 문제를 푸는데 1사분위수와 3사분위수를 새로운 df['1qr'] df['3qr''] 이라는 컬럼을 생성해서 저장하고싶은데 시험 점수에는 영향이없나요
작업형2를 할때 원-핫 인코딩이나 레이블인토딩을 진행해서 더 성능이 좋은 모델을 쓰고 있는데 강의에서 불균형일때 원-핫인코딩처럼 합쳣다가 푸는 방식으로 추천해주셨는데 레이블도 합쳤다가 푸는형식으로 해도 상관이 없는지? 와 안전하게 그냥 둘다 합쳐서 인코딩하는 방식으로 해도 상관없는지 궁금합니다!
안녕하세요 현재 작업형 2 문제 풀이 중 인코딩을 하는 경우 아래와 같이 코드를 작성하고 있습니다 import pandas as pd train= pd.read_csv('/content/churn_train.csv') test= pd.read_csv('/content/churn_test.csv') #(4116, 19) (1764, 18) target= train.pop('TotalCharges') #1. 인코딩 df= pd.concat([train, test]) df1= pd.get_dummies(df) train= df1.iloc[:len(train)].copy() test= df1.iloc[len(train):].copy() 인코딩 후 train, test로 나누는 과정에서 미리 train의 길이를 지정하고 그 변수를 넣는 것이 맞는 걸까요? 아니면 기존의 방식 (위) 처럼 해도 무관한지 궁금합니다 import pandas as pd train= pd.read_csv('/content/churn_train.csv') test= pd.read_csv('/content/churn_test.csv') #(4116, 19) (1764, 18) target= train.pop('TotalCharges') train_len= len(train) #1. 인코딩 df= pd.concat([train, test]) df1= pd.get_dummies(df) train= df1.iloc[:train_len].copy() test= df1.iloc[train_len:].copy()
안녕하세요. 원래는 작업형3을 아예 버리려고 했는데 남은 시간동안 작업형3을 조금이라도 공부하려고 하는데 어떻게 해야될지 모르겠어서 질문글 남깁니다. 우선 빅이시 영상에서 소개하는 summary 확인하는 방법은 숙지해두었는데, 그외에 직접 검정을 하거나, 기초통계에 대한 지식은 거의 없는 상황입니다. 현재 상황에서 어떤걸 하는게 가장 좋은 전략일까요? 기출에 나온 작업형 3 관련 개념들이라도 숙지하고 시험장 들어가는게 현재로선 최선일까요? 감사합니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 선생님. 연습문제 연습하고 있는데요 작업형2에서 선생님의 코드예시로 작성한 파일이랑 제가 만든 파일이랑 확률값의 소수점차이가 나는 이유는 무엇일까요?.. (사진첨부) 혹시 시험에는 무관한건지 여쭤봅니다
작업형1, 2, 3 강의는 모두 수강했고, 현재 기출문제 11회와 10회는 풀었습니다. 이후에 기출문제 9회, 8회 ~ 등을 풀며 준비하는 것이 나을까요? 아니면 실전챌린지 연습문제를 먼저 푸는게 나을까요? 아니면 이번에 새로 공유해주신 코딩팡 환경의 모의문제를 풀까요? 시간이 있으면 모두 풀어보려고 하지만 무엇부터 시작해야할지 조언을 듣고자 질문드립니다
안녕하세요. 11회 기출부터 역순으로 순차적으로 풀어보고 있는데 8회만 해도 MIN MAX 스케일링의 수식을 문제에서 제공하고 있는 반면, 7회 기출은 갑자기 스탠다드 스케일링의 수식을 제공하지 않고, 상관계수를 구할 때 절댓값을 취해야한다는 점도 알려주지 않고있습니다. 사실 스탠다드 스케일링은 고등학교에서도 나오니까 std()함수를 썼는데 이게 또 스탠다스 스케일링을 하고싶을 땐 std()안에 ddof라는 옵션을 0으로 설정해야한다고 하네요.. 빅분기가 시행된지 얼마 안된 시험이어서 이때만 시험 문제가 이렇게 나온거고, 요즘 시험은 그냥 10회, 11회랑 비슷하게 나온다고 받아들이면 되는 것일까요, 아님 이 정도의 배경지식은 작업형 1에서 실제로 필요한게 맞는걸까요? 통계쪽 배경지식은 작업형 3에서만 필요하다고 생각했는데 당황스러워 질문 남깁니다.. 감사합니다.