inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

172만명의 커뮤니티!! 함께 토론해봐요.

작업형 1 모의고사 2번

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 a1 = a[['s1','s2','s3','s4','s5']] sum = a1.sum(axis=1)>0.1 print(sum.sum()) 문제에서 요구한 칼럼을 뽑아서 새로운 데이터 프레임을 만들어서 코딩했습니다. 이렇게 하니 102개가 나왔는데, 어떤 부분에서 문제가 발생하는지 잘 모르겠습니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김주원 댓글 1 좋아요 0 조회수 163

코랩의 노트북 작업시 질문입니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

코랩의 노트북 작업시 질문입니다. 노트북에서 한번 따라쳐보고 밑에서 새로 혼자 작성해보는 식으로 해보는데요, 언제부턴가 한번 코드를 치고난 후에는, 코드가 자꾸 자동완성이 되서 치기도 전에 코드가 완성되더라구요.혹시 노트북내에서 자동완성 기능을 끌 수 있는 방법이 있나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
crystal 댓글 2 좋아요 0 조회수 198

작업형1 모의문제1 - 문제2 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

이렇게 제 나름대로 풀이를 적어서 실행시켜 보았는데, 계속 에러가 떠서 질문 드립니다! 제가 작성한 코드 입니다. from google.colab import drive drive.mount('/content/drive') import pandas as pd import numpy as np df = pd.read_csv('/content/drive/MyDrive/bigdata(빅분기 놀이터)/빅분기 놀이터 Dataset/members.csv') cond1 = df.isnull().sum() / len(df) >= 0.3 df[cond1] = df[cond1].dropna() cond2 = (df.isnull().sum() / len(df) >= 0.2) | (df.isnull().sum() / len(df) < 0.3) df[cond2] = df[cond2].fillna(df[cond2].mode()[0]) print(len(df[df['f3'] == 'gold']))

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
세린 댓글 1 좋아요 0 조회수 218

작업형1 모의문제1 오류

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

계속 이렇게 오류가 뜨고 파일이 안불러와지는데 어떻게 해야하나요..?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
codud0838 댓글 3 좋아요 1 조회수 266

양측검정의 pvalue

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

양측검정의 pvalue는 해석할때 그대로 해석하면 되는걸까요? 예를들어 검정결과가 MannwhitneyuResult(statistic=27036.0, pvalue=0.9807458376150018) 이런식으로 나왔다면 귀무가설을 지지한다는 결과는 같지만, 양측검정이어서 pvalue가 0.98에 대한 1/2의 값인 0.49로 인해서 지지한다고 봐야할지, 아니면 그대로 0.98이어서 지지한다고 해석해야할지 헷갈립니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
nahye1137 댓글 1 좋아요 0 조회수 170

statsmodel.formula.api.ols와 sklearn.linear_model.LinearRegression의 차이

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선형회귀분석에서 statsmodel.formula.api.ols와 sklearn.linear_model.LinearRegression의 차이가 궁금합니다. 어떨 때 ols를 쓰고, 어떨때 LinearRegression을 쓰는지 구분이 잘 안돼요.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
ookim 댓글 2 좋아요 0 조회수 469

작업형2 채점

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

작업형 2 풀이를 할 때 수치형 데이터들 따로 건들지 않고 id 부분만 삭제하고 object형 데이터들을 단순 삭제 하고 모델 학습 후 검증 데이터로 평가했을때 어느정도 %가 나와야지 채점을 할 때 만점 받을 수 있을까요?단순하게 데이터를 전처리해도 검증 데이터로 평가했을 때 90% 정도가 나온다면 하이퍼파라미터 변경이나 수치형 데이터 스케일링, object형 원핫, 레이블 인코딩을 굳이 할 필요는 없는 것일까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이민규 댓글 1 좋아요 0 조회수 154

라이브러리 및 데이터 불러오기 그리고 EDA, 16:45 부분

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

저는 아무리 해도 계속 값들이 (0,0)으로 나오는데 어떤 부분이 잘못된 것 일까요?ㅜㅜ

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
dkqehs 댓글 1 좋아요 0 조회수 129

작업형 2 질문드립니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요. 좋은 강의 항상 감사드립니다. 작업형2번 검증데이터 나누기 부분 질문드립니다. 어떤 문제에서는 cols에 범주형 데이터를 제외하고 -> 랜덤포레스트(섹션10 작업형2신유형), 어떤 문제는 labelencoder -> 검증데이터 나누기 -> 모델 학습 및 평가로 이어지는데요. 범주형 데이터가 적을 경우 cols에 범주형 컬럼은 빼고 적은 후 (labelencoder 안하고) 바로 모델 학습을 해도 괜찮은가요?(섹션10 작업형2) 검증데이터 나누기 작업이 들어간 문제들은 어떤 상황이라서 인가요? 꼭 필요한 작업인가요? 감사합니다!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
rkgml5153 댓글 1 좋아요 0 조회수 158

문단맞춤 설정법이 있을까요?

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강의에서 선생님 결과값은 보기 좋게 나오는데 저는 이렇게 컬럼이 뒤로 갈수록 칸이 보기가 안좋아서 설정법이 따로 있는지 문의 드립니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
칩멍크704 댓글 1 좋아요 0 조회수 118

기출6 유형1 문의드립니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 문의드립니다. 그룹바이 정의값을 df['월평균']으로 넣으면 오류가 나고 df['월평균'] = df.groupby('연도')['총범죄'].sum()/12 df['월평균'] result로 넣으면 오류가 안나는 이유가 뭘까요? result = df.groupby("연도")['총범죄'].sum()/12 result

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
서수영 댓글 1 좋아요 0 조회수 142

수식의 String을 변수에 저장

해결됨

직장인에게 꼭 필요한 파이썬-아래아한글 자동화 레시피

안녕하세요 일코님 이번에 질문드릴 내용은 선택된 영역의 수식의 String을 변수에 저장하고 싶어서 질문드립니다. 일전에 질문드린 내용에서 hwp.get_selected_pos()를 사용하여 선택된 영역의 위치값을 알 수 있었는데요 이 위치값 안에 위치한 수식의 String을 가져오고 싶어서 문의드립니다. 123과 1/3은 수식으로 입력된 내용입니다. 만약 선택된 내용을 hwp.get_selected_pos()로 받고 math_string = '앞은 문자' + 123 (123은 수식에서 가져온 'String') 이런식으로 변수에 선언해주고 싶다면 어떻게 해야할까요.. (문자와 수식이 혼합된 경우 동일한 순서로 값을 받는 방법이 있을지 궁금합니다.) selected_pos 안에 ctrl을 조회하는게 이전에 설명주신 내용에서는 전체 문서의 ctrl_list의 UserDesc를 조회를 하게되는 방식이였는데 선택된 내부의 ctrl만 조회하게 하는 방법은 없는지도 질문드립니다.

  • python
  • 한컴오피스
YongJun(Passion) 댓글 3 좋아요 2 조회수 206

모델 randomstate 값

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

전 강의 분류에서 랜덤포레스트 모델 불러올 때는 model = RandomForestClassifier(random_state=2022) randomstate 값 주었는데 이번 강의에서는 model = LinearRegression() 값을 주지 않았네요. 전 강의에서는 baseline, 원핫 , 라벨 인코딩 등 여러번 비교하면서 평가해야해서 고정시켜준건가요? 이번 강의에서는 라벨인코딩만 사용하기로 해서 굳이 고정시킬 필요 없나요? 또한 이번 강의에서는 단순 object만 제거하는 baseline, 원핫 인코딩 라벨 인코딩 평가 점수를 비교하지 않는데 이유가 있을까요? 또한 랜덤포레스트, 선형회귀 등 여러 모델이 있는데 어떠한 경우에 각 모델을 사용해야 하는지 기준이 있을까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이민규 댓글 1 좋아요 0 조회수 198

자꾸 오류가 납니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

# 검증데이터 분리 from sklearn.model_selection import train_test_split X_tr, y_tr, X_val, y_val = train_test_split(train.drop('TravelInsurance', axis=1), train['TravelInsurance'], test_size=0.2, random_state=2002) X_tr.shape, y_tr.shape, X_val.shape, y_val.shape 이렇게 한 이후에 # 랜덤포레스트 from sklearn.ensemble import RandomForestClassifier from sklearn.metrics import accuracy_score model = RandomForestClassifier() model.fit (X_tr, y_tr) (밑에 코드는 생략했습니다) 근데 오류가 model.fit (X_tr, y_tr)에서 난다고 뜹니다. 오류 : Found input variables with inconsistent numbers of samples: [1192, 298] 이렇게 뜹니다,. 뭐가 문제인지 모르겠습니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
뚜디니 댓글 1 좋아요 0 조회수 208

데이터 전처리 중 삭제

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

타겟 데이터를 보고 타겟 데이터에 영향을 주지 않을 만한 요소들 (이 강의에서는 name, host_name, host_id, last_review )을 직접 EDA 할 때 보고 정해주면 되는 것인가요? 만약 필요한 데이터를 삭제한다든가 불 필요한 데이터를 남겨뒀을 때 평가 지표가 낮게 나온다면 다시 불필요한 데이터를 선별하는 전처리 작업을 반복하면서 진행하는 것인가요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이민규 댓글 2 좋아요 0 조회수 239

회귀, 분류

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

해당 문제가 회귀 문제인지 분류 문제인지는 평가 방법을 통해 판단하는 것인가요? 아니면 타겟 데이터 형태를 통해서 판단하는 것인가요? 타겟 데이터가 0,1 분류 데이터면 분류를하고 타겟 데이터가 그렇지 않을 때 회귀 적용하는 것인가요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이민규 댓글 2 좋아요 0 조회수 291

작업형2 평가

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

제 기준에서는 baseline (단순 object 제거)으로 했을 때 점수가 가장 높았습니다. 질문 강사님은 레이블 인코딩일 때 auc 점수가 가장 높던데 학습 데이터가 동일하더라도 평가 점수는 다를때가 많나요? 문제에서 auc 등 어떤 지표를 기준으로 평가하는지 명시해주나요? 그러면 그 평가 지표가 가장 높은 피처 엔지니어링 방법으로 진행하면 될까요? 수치형 데이터 스케일링은 진행 안 하신 이유가 궁금합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이민규 댓글 2 좋아요 0 조회수 205

model.selection 하는경우와 안하는경우

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

1) 안녕하세요 sklearn.model_selection ~ 으로 트레인/테스트 분리하는건 어떤상황에서 하고 어떤상황에서 안하는지 궁금합니다. 직전 4회 기출(작업형2)에서는 basic/intermediate 단계에서는 안했던것 같거든요, 마찬가지로 5회기출도 분리하지 않고 랜덤포레스트로 예측진행해도 될까요? 해도되고 안해도되는 상황을 잘모르겠어서 질문드려요 2) 그리고 어떤상황에서는 random_state=2022 이고 어떤때는 random_state=0 이던데 이것도 사용 기준이 있을까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
FU 댓글 2 좋아요 0 조회수 189

generate expression 사용 예시

해결됨

실무에서 사용하는 클라우드 보안 프로그래밍 (AWS, Python, Terraform)

안녕하세요 1.14 generator expression 강의 내용 중에서 athena로 s3의 저장된 로그를 쿼리하여 로그를 긁어온다는 예시에서 2가지 궁금증이 있습니다. 아테나로 긁어온 로그의 용량이 큰 경우, 리스트 컴프랜션으로 올리면 메모리를 많이 차지한다고 말씀해주셨습니다. 아테나 쿼리 결과는 보통 s3에 저장되는데, 람다를 예시로 들으신 이유는 어떤 워크플로우를 생각하시고 예시로 들으신건지 궁금합니다. (람다로 아테나 쿼리 결과를 읽고 특정 형태로 파싱하는 경우, 파일을 리스트 컴프랜션으로 읽으면 람다의 메모리를 오바하여 람다가 죽는 경우를 말씀해주신걸까요?) 임시스토리지에 저장해서 generate expression을 통해 읽어온다는 부분에서 궁금한 점입니다. 레디스로 예를 들면 아테나 쿼리 결과를 [{"key" : "value"}]와 같이 레디스에 저장해둔 후 필요 시 데이터를 generate expression을 사용해서 읽어 온다는 걸까요? 저같은 경우 아테나는 단순 로그 파일을 조회하는 용도로만 사용해 보았고, 람다와 연동해서 사용해 본 경험이 없어 예시로 들어주신 사례가 어떤 상황인지 명확하게 떠오르지가 않습니다. 이런 부분은 검색을 통해 개인적으로 찾아봐야 되는게 맞는데, 어떤 키워드로 검색해야 하는지 감이 잘 안와서 질문드리게 됐습니다.

  • python
  • aws
  • Terraform
  • devsecops
형빈 댓글 1 좋아요 1 조회수 216

4회 기출 유형 (작업형2) 관련 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 선생님! xgboost를 사용해 예측을 진행하려고 하니, ValueError: Invalid classes inferred from unique values of `y`. Expected: [0 1 2 3], got [1 2 3 4] 위와 같은 에러코드가 나와, chat gpt에 물어보니, XGBoost 가 클래스 레이블을 0부터 시작하는 정수 값으로 기대하기 때문입니다. 즉, XGBoost 는 클래스 레이블이 [0, 1, 2, 3] 과 같은 형식을 갖추기를 기대하는데, 현재 데이터는 [1, 2, 3, 4] 로 되어 있습니다. 이 문제를 해결하려면 클래스 레이블을 0부터 시작하도록 변경해야 합니다. 라고 답변을 주었는데, 코드를 수정해준 것을 보니, y 변수에 train['Segmentation']을 할당하여 LabelEncoding 을 진행하여 0부터 시작하는 데이터로 변환시켜주는 코드를 줬는데, 이 코드를 사용하여 예측하고 제출 csv 파일까지 만들어 확인해보니, Segmentation 예측을 1,2,3,4 로 한 것이 아닌 0,1,2,3 으로 예측하였는데... xgboost를 사용하기 위해서는 어느 부분을 수정하여야 할까요? 감사합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
염민서 댓글 1 좋아요 0 조회수 180

인기 태그

인프런 TOP Writers

주간 인기글