생각보다 판다스 이론 공부하는데 머리 속에 쉽게 들어오지 않내요. (파이썬 진도는 다 나감) 지금 제가 판다스 15 내장함수 중인데 그동안에 하나 넘어갈 때 마다 좀 진도는 늦게 나가도 코랩에서 주석을 이용해서 몇번씩 반복을 하면서 나가고 있어요. 이런식으로 해서 과연 끝까지 다 나갈지는 의문이긴 한데 어떤식으로 하는게 좋은지 한번 조언 듣고자 글 올렸어요. 시간 되면 답변 부탁합니다.
list(train.columns[train.dtypes == object]) # 인코딩을 위해 train + test print(train.shape, test.shape) df = pd.concat([train, test]) print(df.shape) << 인코딩과정에서 이 두가지를 꼭 해야할까요 분류형문제에선 이 두가지를 안했었는데 회귀형문제에서는 unique수가 많이 차이나서 한다고 하셨는데 이 두가지 안하고 그냥 그 unique수 많은 컬럼을 삭제한 뒤에 원핫인코딩을 진행하면 안되나요?
안녕하세요 강사님. 저번에 응시했던 실기 10회 시험을 아쉽게 불합격해서, 이번 11월 29일에 치뤄질 실기 11회 시험을 응시하기 위해 강의를 다시 보고자 합니다. 그러나 제가 1년 전에 강의를 구매해서 11월 4일에 강의가 만료되는 상황입니다. 염치없지만 혹시 10일정도 강의 연장 가능한지 여쭤봅니다..! ㅠ 감사합니다. (참고로 제 이메일은 duddms0268@gmail.com 입니다.)
안녕하세요. 2회기출문제의 경우 특이하게 train데이터가 2개로 나뉘어 제공되었는데 concat 함수로 작업을 하셨는데 id가 공통적으로 있긴 하지만, 동일한 순서로 되어있는지 알수 없어서 merge 함수를 사용하여 on = "id" 옵션을 추가하여 train데이터를 하나로 만들었는데 concat, merge, join 어떤 걸 사용해도 괜찮을까요 ? 언제나 답변해주셔서 감사합니다 :)
안녕하세요. 퇴근후딴짓 빅데이터 분석기사 실기를 수강중인 학생입니다. 다름이 아니라 빅데이터 분석기사 실기 시험이 11월29일인데 강의 만료일이 11월13일이라 실기 시험 전 16일동안 강의를 듣지 못하네요. ㅠㅠ 시험전까지 동영상을 복습하면서 시험을 준비했으면 하는데요. 시험일까지 수강 기간을 연장할 수 있는지 문의드립니다. 감사합니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하십니까? 해당 강의 내용 중 회귀계수가 아래처럼 나오게 되는데 그럼 여기서 유형 A에 대한 회귀계수를 알고 싶으면 어떻게 해야하나요? summary로는 유형A의 회귀계수는 보는방법은 없을까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요? 실기 체험환경에서 신뢰구간 구할때 결과가 이렇게 나오면 신뢰구간을 보려면 어떻게 하나요? 3,4번째 컬럼을 따로 지정해서 봐야하나요??
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요, 이번 11/29 빅분기 시험을 사정상 보기 어려워져서 학습기간 멈춤를 신청하고 싶은데 최대 몇개월 학습 중단이 가능할까요? 내년 3월이후 다시 준비해서 시험을 치뤄야 될 것 같습니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 캐글에 있는 문제들 코랩에서 풀어보려고하는데 데이터를 어떻게 불러와야하는지 모르겠어요ㅜ 깃허브 URL이나 이런건 없나요? import pandas as pd import numpy as np df = pd.read_csv('../input/titanic/train.csv')
안녕하세요. 제목과 같이 독립성검정의 경우 chi2_contingency 함수를 사용하는데 공부하다 보니 chi2_contingency(table, correction = True) 이렇게 되어있는 글을 보게 되어서 검색하여보니 correction 옵션은 자유도와 관련된 부분이라고 해서 자유도가 1인 경우에는 True이고 , True가 기본값이긴 하지만 1보다 클 경우에는 False를 사용해야 한다고 하는데 예시 문제를 살펴보면 ddof = 1인 경우에만 있었는데 혹시 실기에서도 해당 부분을 고려해야 할까요 ? 감사합니다 :)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 아래처럼 concat으로 한 이후에는 model_selection시에 train_oh와 test_oh가 더 나오진 않나요?? X_tr, X_val, y_tr, y_val = train_test_split(train_oh, target, ,,) 이 되지는 않는지요?? print(train.shape, test.shape) data = pd.concat([train, test], axis=0) data_oh = pd.get_dummies(data) train_oh = data_oh.iloc[:len(train)].copy() test_oh = data_oh.iloc[len(train):].copy() print(train_oh.shape, test_oh.shape)
안녕하세요. EDA 단계에서 수치형컬럼들의 기초통계량을 해보니 SeniorCitizen이 0과 1로 나뉘어있는거 같아 변수 확인 후, 해당 컬럼을 범주형으로 변환 후, 작업하였는데 이렇게 변경하여 작업해도 괜찮을까요 ? 범주형으로 변경 후, 작업하였을 때 # 원핫인코딩 : 946.3475544795037 946.7024808036148 # 레이블인코딩 : 951.0960435538027 952.7925407798712 다음과 같이 결과 값이 나왔습니다. 감사합니다 :)
# your code import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv") cols1 = df.columns[df.isnull().sum() >= len(df) * 0.3] df = df.dropna(subset=cols1) cols2 = df.columns[(df.isnull().sum() < len(df) * 0.3) & (df.isnull().sum() >= len(df) * 0.2)] for col in cols2: df[col] = df[col].fillna(df[col].mode()[0]) print(sum(df['f3'] == 'gold')) 문제에서 결측치가 30% 이상인 컬럼을 찾으라 했는데, 저는 이렇게 조건에 해당하는 컬럼들을 리스트 형태로 구해서 subset에 넘겨주었는데, 선생님 풀이를 보니 subset=['f1'] 이런 식으로 조건에 해당하는 컬럼의 이름을 직접 명시하셨더라구요..! 이런 문제를 풀 때 조건문을 이용해서 조건에 해당하는 컬럼들을 일괄적으로 선택할 필요는 없나요? 제가 아직 이 시험의 문제 유형을 잘 파악하지 못했는데, 이 시험이 혹시 코딩테스트를 예로 들면 "2+3의 값을 출력하시오" 라는 문제의 답을 print(2+3)이 아닌 print(5)로 써도 답은 맞으니 정답 처리가 되는 방식인가요? 감사합니다.