inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

172만명의 커뮤니티!! 함께 토론해봐요.

shapiro 검정을 하는 경우, 반드시 정규성을 따르지 않는 것 아닌가요?

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

현재 독립표본검정 - 단일표본검정, 대응표본검정까지 들었습니다. 문제에 '정규분포에 따른다'는 말이 없으면 shapiro 검정을 통해 정규분포를 따르는지, 아닌지부터 따져야 하는데 현재 강의의 예는 정규분포를 따르지 않는 것만 있는 것 같아서 확인 차 여쭙습니다. shapiro 검정 결과 정규분포를 따를 때에는 문제에 정규분포를 따른다고 할 때와 같이 wilcoxon이 아닌 ttest로 검정하는것 맞을까요 ?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
aprilminji 댓글 2 좋아요 0 조회수 532

캐글 T1-35번 (2)문제 질문드립니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

선생님 안녕하세요. T1-35 2번문제 풀다가 질문있습니다. 이렇게 풀때, 정답이 아무리해도 10580.0이 나오는데 어디 부분이 잘못되었을까요? new = df[df['Feedback'].str.contains('제품')] new.groupby('Category')['Feedback'].size() #서비스 df['OrderDate'] = pd.to_datetime(df['OrderDate']) df['ArrivalDate'] = pd.to_datetime(df['ArrivalDate']) df['배송시간(분)'] = (df['ArrivalDate'] - df['OrderDate']).dt.total_seconds()/60 answer = new[new['Category'] == "서비스"]['배송시간(분)'].mean() answer

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
미미밍 댓글 1 좋아요 0 조회수 157

섹션10. 예시문제 작업형3에서 오즈비 질문 드립니다

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요~ 작업형3에서 오즈비에 대해 질문드립니다. 한 단위가 아닌, 두 단위로 오즈비를 증가시킬 때는 exp( exp ( -0.3539) ) 로 하면될까요? 여기선 하나의 독립변수에 대해서만 오즈비를 구하라고 되어있는데, 만약 2 개의 독립변수에 대한 오즈비를 구하라고하면 어떻게 구하나요?? 이건 이론적으로 가능한건지 잘모르겠어서 질문드립니다.. 다시 말하면 오즈비는 하나의 독립변수에 대해서만 적용이 가능한건가요? 아니면 여러개의 독립변수를 고려하여 구할 수 있는건가요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
sonovan 댓글 1 좋아요 0 조회수 293

실전연습 작업형 1-3 문제 에러

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

마지막 부분 에러났는데,, 실제 강의에서도 에러이던데,, 이유가 무엇인가요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
lovelove567 댓글 1 좋아요 0 조회수 177

예시문제 작업형2 신버전 문의드립니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 예시문제 작업형2 신버전 풀어보았는데 평가값은 0.615 pred는 아래와 같이 나왔는데 맞게나온걸까요? 그리고 아래와 같이 풀어보았는데 혹시 아래와 같은 풀이에서 #원핫인코딩과 레이블인코딩을 넣을수있을까요? 넣으려면 어떤 문장으로 넣어야될까요? (오류가 뜨더라구요ㅠ) #아니면 굳이 인코딩 안하고 아래처럼 제출해도될까요? #데이터불러오기 import pandas as pd train = pd.read_csv("data/customer_train.csv") test = pd.read_csv("data/customer_test.csv") # 확인/전처리/분리/모델/평가/예측/저장 # roc_auc(pred=predict_proba) / 양성(1)값=남자/ 분류모델 #확인 # print(train.shape, test.shape) #print(train.head()) #print(test.head()) # print(train.info()) # print(test.info()) # print(train.isnull().sum()) # print(test.isnull().sum()) #전처리(결측값제거/문자제거/인코딩) ##결측값제거 train['환불금액'] = train['환불금액'].fillna(0) test['환불금액'] = test['환불금액'].fillna(0) ##문자제거 cols=train.select_dtypes(include='object').columns #문자만 cols train = train.drop(cols,axis=1) #문자제거 test = test.drop(cols,axis=1) ##인코딩 #분리 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split( train.drop('성별',axis=1), train['성별'], test_size=0.2, random_state=2022 ) #모델 from sklearn.ensemble import RandomForestClassifier model = RandomForestClassifier() model.fit(X_tr,y_tr) pred = model.predict_proba(X_val) #평가 from sklearn.metrics import roc_auc_score print(roc_auc_score(y_val, pred[:,1])) #예측 pred = model.predict_proba(test) submit = pd.DataFrame({ 'pred':pred[:,1] }) #저장 submit.to_csv('28381.csv', index=False) print(pd.read_csv('28381.csv'))

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
서수영 댓글 1 좋아요 0 조회수 177

자주 활용되는 판다스 예제 퀴즈 2번 질문 (오류발생)

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

선생님과 같이 한것 같은데, 원두 컬럼 내 결과값이 아래와 같은 이유가 뭘까요... 못찾겠습니다 이유를ㅠ 조언 부탁드립니다. 감사합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김태선 댓글 1 좋아요 0 조회수 157

문제 처음 시작할떄!!

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

시작할때 이부분은 실제 시험환경에서도 제가 직접 입력해야 하는 부분인가요??? 아니면 주어지는 부분인가요???

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
lovelove567 댓글 2 좋아요 0 조회수 203

기출 2회 작업형1

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

선생님! 2번 문제에서 결측치를 중앙값으로 바꾸기 전의 표편과 바꾼 후의 표편 차를 구하라는 문제에서 만약 결측치를 바꾸기 전 표편을 구하지 못한채로 결측치 처리를 해버렸다면 시험상황에서는 다시 원 데이터로 어떻게 돌아갈 수 있나요,,? (시험환경에서는 코랩처럼 '이전셀 실행' 기능을 쓸 수가 없는데)drop같은 함수를 써서 원래 데이터를 일부 삭제 시켰다가 실수가 생겨 다시 복구해야하는 상황에서도 어떻게 해야하는지 궁금합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
박나현 댓글 2 좋아요 0 조회수 223

유형별 제출방법 문의

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

시험 회차가 증가함에 따라 제출 방법이 조금씩 달라진 것 같은데요. 유형1, 유형3의 경우, 코딩화면 제출버튼은 없어지고 별도 답안제출 화면에 정답만 입력하는게 맞는지요? 그렇다면 코딩 중간에 있는 print()문을 주석(삭제) 처리할 필요도 없는건지요? 유형2의 경우도 코딩 중간에 있는 print()문을 주석(삭제) 처리 필요 없는지요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
kplane 댓글 2 좋아요 0 조회수 236

섹션10- 예시문제 작업형2(신버전) 문의

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 섹션10- 예시문제 작업형2(신버전) 아래 풀이에서 어떤것이 잘못됬는지 알 수있을까요ㅠ? # 출력을 원하실 경우 print() 함수 활용 # 예시) print(df.head()) # getcwd(), chdir() 등 작업 폴더 설정 불필요 # 파일 경로 상 내부 드라이브 경로(C: 등) 접근 불가 #데이터불러오기 import pandas as pd train = pd.read_csv("data/customer_train.csv") test = pd.read_csv("data/customer_test.csv") # 확전분모평예정 # roc_auc(pred=predict_proba) / 양성(1)값=남자/ 분류모델 #확인 # print(train.shape, test.shape) # print(train.head()) # print(test.head()) # print(train.info()) # print(test.info()) # print(train.isnull().sum()) # print(test.isnull().sum()) #전처리(결측값제거/문자제거/인코딩) #결측값제거 # print(train.isnull().sum()) train['환불금액'] = train['환불금액'].fillna(0) # print(train.isnull().sum()) test['환불금액'] = test['환불금액'].fillna(0) #문자제거 cols=train.select_dtypes(include='object').columns cols # print(train.info()) train = train.drop(cols,axis=1) # print(train.info()) test = test.drop(cols,axis=1) #cols = ['회원ID', '총구매액', '최대구매액', '환불금액', '방문일수', '방문당구매건수', '주말방문비율', '구매주기'] #target = train.pop('성별') #pop=성별을 target에 대입하고 나머지를 drop #인코딩 train = pd.get_dummies(train, columns=cols) test = pd.get_dummies(test, columns=cols) #분리 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split( train.drop('성별',axis=1), train['성별'], test_size=0.2, ramdom_state=2022 ) #모델 #pred=predict_proba from sklearn.ensemble import RandomForestClassifier model = RandomForestClassifier() model.fit(X_tr,y_tr) pred = model.predict_proba(X_val) print(pred) print(pred[:,1]) # #평가 from sklearn.metrics import roc_auc_scoer print( roc_auc_scoer(y_val, pred[;,1]) ) --실제,예측 # #예측 pred=model.predict_proba(test) pred submit = pd.DataFrame({ 'pred': pred[:,1] }) submit # #저장 submit.to_csv('result.csv', index=False) print(pd.read_csv('result.csv')) # 사용자 코딩 # 답안 제출 참고 # 아래 코드는 예시이며 변수명 등 개인별로 변경하여 활용 # pd.DataFrame변수.to_csv("result.csv", index=False)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
댓글 2 좋아요 0 조회수 175

섹션10 예시문제 작업형 1번

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요. 섹션10 예시문제 작업형 1번 질문있습니다.캐글에서 하던대로 하다보니 식이 강의에서 알려주시는 것에 비해 짧아졌는데요. import pandas as pddf = pd.read _csv("data/mtcars.csv") from sklearn.preprocessing import MinMaxScalerscaler = MinMaxScaler()df['qsec'] = scaler.fit _transform(df[['qsec']])#print(df['qsec']) cond = df['qsec'] >0.5print(sum(cond)) 이렇게 해도 9가 나오는데, 이렇게 풀어도 괜찮나요?좋은 강의 항상 감사드립니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
rkgml5153 댓글 1 좋아요 0 조회수 164

4회기출 작업형2유형 강의 에서 수치형 범주형

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요. 4회기출 작업형2유형 강의에서 basic방법과 intermediate 방법이 있는데 실제 시험에서는 수치형 데이터만 활용(basic)해서 해도 되나요? 범주형 데이터가 있다면 범주형 데이터도 활용 해야할까요?...ㅠ 안그러면 점수를 낮게 받을까요?..ㅠ 이 강의회차에서는 basic방법이 성능이 더 좋게 나왔는데 수치형만 쓸지 수치형과 범주형 둘다 활용할지 어떻게 판단해야하나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
hz 댓글 1 좋아요 0 조회수 194

6회 2번 문제

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 : ) 좋은 강의 잘 보고 있습니다. 다름이 아니라 시험 때 분류 / 회귀 랜덤 포레스트 활용하는게 안전할까요? 분류시 AdaBoostClassifier 사용하니까 랜포 보다 조금 더 좋은 성능 보이던데 혹여나 더 높은 성능 좋은 모델 했다가 과대 적합으로 떨어질까봐 걱정되네요 ㅠㅠ

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
꾸꾸 댓글 1 좋아요 0 조회수 161

선생님 질문이 있습니다!

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 랜덤포레스트 학습과정 중에 from sklearn.ensemble import RandomForestClassifier model = RandomForestClassifier() model.fit(X_tr, y_tr) pred = model.predict_proba(X_val)[:,1] roc_auc를 학습하기위해 pred = model.predict_proba(X_val)[:,1] 해당코드를 사용하셨는데 [:,1] 부분이 이해가 잘안되어 질문드립니다. 인덱스 전체/ 1번 칼럼까지 범위를 설정하는 이유가 있을까요? 아니면 제가[:,1] 의미를 위처럼 잘못 이해하고 있는거라면 짚어주시면 감사하겠습니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이지훈 댓글 2 좋아요 0 조회수 260

섹션 7-3, dev container 관련 질문

해결됨

실전도커: 도커로 나만의 딥러닝 클라우드 컴퓨터 만들기

선생님 안녕하세요 좋은 강의 감사합니다. 섹션 7의 세번째 강의, python의 위한 도커 의 13:25 에서 바로 torch를 pip으로 설치하지 않고도 바로 import torch를 할 수 있는 이유는 azure vm을 만들때 선택한 size인 nc4as_t4_v3 4 vcpus 에 기본적으로 torch가 깔려있기 때문인가요 (즉, 만약 gpu를 사용하지 않는 다른 환경을 고르면, torch가 안깔려 있어서 pip 으로 깔아야 하는 것인가요) cpu만 사용하는 size인 Standard D2s v3 (2 vcpus, 8 GiB memory) 로 가상환경을 만들었는데, 여기서는 ipynb 파일에 !pip install torch를 해도, import torch를 하면 torch가 없다고 나오는데, 혹시 이 이유를 아실까요..ㅠ

  • python
  • 딥러닝
  • linux
  • docker
  • azure
  • 가상화
  • mlops
nathan 댓글 2 좋아요 1 조회수 282

이 문제에서 수치형 데이터와 범주형 데이터를 분리하는 과정이 꼭 필요한가요?

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강사님은 수치형 데이터와 범주형 데이터를 n_train, c_train, n_test, c_test로 분리하셨더라구요. 근데 꼭 분리 안하고, col 명만 설정해서 그냥 피처엔지니어링 하면 안되는 걸까요? 근데 저는 점수가 0.75 정도밖에 안나왔습니다 ㅎㅎㅎ 강사님은 0.8 넘게.... 제가 쓴 코드입니다.. # 수치형 스케일링 from sklearn.preprocessing import RobustScaler scaler = RobustScaler() cols = ['Age', 'AnnualIncome','FamilyMembers', 'ChronicDiseases'] <- 제가 변환하고 싶은 int 형 변수들을 넣었어요. 타겟레이블이 int형인데 뺄줄 몰라서 그냥... train[cols] = scaler.fit_transform(train[cols]) test[cols] = scaler.fit _transform(test[cols]) # 라벨인코딩 from sklearn.preprocessing import LabelEncoder cols2 = train.select_dtypes(include="object").columns for col in cols2 : le = LabelEncoder() train[col] = le.fit_transform(train[col]) test[col] = le.transform(test[col]) 이러고 데이터 X_tr, X_val, y_tr, y_val로 분리하고 랜덤포레스트를 적용헀습니다!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
져니 댓글 2 좋아요 0 조회수 292

오늘부터 강의를 받게 되었습니다!

미해결

프로그래밍 시작하기 : 파이썬 입문 (Inflearn Original)

기획자이지만 파이썬이 중요하다고 하여, 관련 베이스적인 지식을 쌓고자 강의 자료를 요청드립니다!! woooha94@gmail.com

  • python
an soojin 댓글 2 좋아요 0 조회수 127

작업형2 회귀, 작업형3 회귀

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 작업형2에서 모델링 및 평가에서 회귀모델 여러가지를 대입해보던 것과 작업형3 회귀분석에서 formula 패키지 사용해서 회귀식 사용하는것은 어떤 차이가 있을까요?? 회귀분석이라고 해서 혼자 타이핑을 andomforestregressor 해보다가 지우고 formula를 따라 썼는데 너무 초보적인 질문일것같지만 궁금해서 문의드립니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
jmeom 댓글 1 좋아요 0 조회수 187

메모장 이용 불가로 변경되었습니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 강의 잘 듣고 있습니다. 지난 시험부터 메모장 이용 불가로 변경되었는데 강의 내용에 업데이트 반영이 되어 있지 않아서 공유드립니다. o 시험 중 필기구, 전자·통신기기(계산기 등) 및 PC에 설치되어 있는 프로그램(윈도우 메모장, 윈도우 계산기, 엑셀 등) 사용 불가 https://www.dataq.or.kr/www/board/view.do?bbsKey=eyJiYnNhdHRyU2VxIjoxLCJiYnNTZXEiOjU1MzQ3NX0=&boardKind=notice 감사합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
피카츄라이츄 댓글 2 좋아요 0 조회수 304

이 문제에서 df=pd.concat 으로 X_train과 y_train의 타겟을 합치는 이유가 무엇인가요?

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

train이 두개로 나누어져서 제공되서 x_train+y_train['타겟'] 을 합치는거까지는 이해했는데요 이걸 df에 받아서 넣는데 그 다음 코드부터는 df를 사용하지를 않더라고요! 그래서 모든 코드 다 작성 후에, df=concat 어쩌구 했던거를 주석처리해서 숨겨봤는데도 같은 결과가 나왔어요. 합쳐진 df를 어딘가에 사용한다면 이해가 되는데, df를 사용하지도 않는데 concat으로 합쳐놓는 이유가 무엇인가요? 참고 차 제가 작성했던 코드도 붙여넣어봅니다. import pandas as pd X_train = pd.read _csv("X_train.csv") X_test = pd.read _csv("X_test.csv") y_train = pd.read _csv("y_train.csv") # print(X_train.shape, X_test.shape, y_train.shape) df = pd.concat([X_train, y_train['Reached.on.Time_Y.N']], axis=1) df # 라벨인코딩 from sklearn.preprocessing import LabelEncoder cols = X_ train.select _dtypes(include="object").columns for col in cols : le = LabelEncoder() X_train[col] = le.fit _transform(X_train[col]) X_test[col] = le.transform(X_test[col]) # # 랜덤 포레스트 위해서 데이터 분리 X_train = X_train.drop("ID", axis=1) X_test_id = X_test.pop("ID") # # 데이터 분리 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split( X_train, y_train['Reached.on.Time_Y.N'], test_size=0.2, random_state=2022 ) # 랜덤포레스트 from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=2022, max_depth=3, n_estimators=200) rf.fit (X_tr, y_tr) pred = rf.predict_proba(X_val) from sklearn.metrics import roc_auc_score print(roc_auc_score(y_val, pred[:,1])) pred = rf.predict_proba(X_test) submit = pd.DataFrame({ "ID" : X_test_id, "Reached.on.Time_Y.N" : pred[:,1] }) submit.to _csv("submit.csv", index=False) pd.read _csv("submit.csv")

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
져니 댓글 1 좋아요 0 조회수 316

인기 태그

인프런 TOP Writers

주간 인기글