inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

173만명의 커뮤니티!! 함께 토론해봐요.

작업형2 cvs 제출전 확인하기

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 마지막 result.csv 제출할때 index=False 하잖아요 그 이유가 처음에 문제 답안 예시처럼 pred만 나오게하려고한다고 알고있는데 마지막 확인차 pd.read로 확인시 pred 0 2 1 0 2 0 3 2 4 0 이렇게 인덱스번호가 그대로 나오는데 원래 이런건가요? index=False 만 잘 붙이면 괜찮은 거 맞나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
gamb21 댓글 2 좋아요 0 조회수 54

작업형2문제에서 데이터프레임 저장 후 확인절차에서

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

print(pred.shape) print(pd.read_csv('result.csv').head(5)) 데이터프레임 저장 후 확인과정에서 이 부분을 확인 후 주석처리한 다음에 제출해야 되는지요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
rurim 댓글 2 좋아요 0 조회수 48

체험환경에서 rmse

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

체험환경에서 풀어보고 있는데 rmse가 없다고 뜨네요. 올려주신 풀이를 외워서 시험장에 가야할까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
안하은 댓글 2 좋아요 0 조회수 40

작업형2 오브젝트 카테고리 확인할때

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

오브젝트 카테고리가 동일한지 알아보려고 set이용하는것과 nunique()로 알아보는게 다른가요? nuique()로 동일한 숫자가 나오면 카테고리가 동일하다고 볼수 없나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
rurim 댓글 2 좋아요 0 조회수 44

작업형2 전처리 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

cols = [ '지역', '작물종류', '토양유형', '등급'] from sklearn.preprocessing import LabelEncoder le = LabelEncoder() df= pd.concat([train,test]) for i in cols: df[i] =le.fit_transform(df[i]) train = df.iloc[:4000] test = df.iloc[4000:] print(train.shape, test.shape)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
댓글 2 좋아요 0 조회수 36

작업형 2 평가 질문있습니다

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 작업형 2에서 만약 앞에서 모델만 잘 만들었다면 굳이 평가안하고 바로 테스트하고 제출해도 될까요? 예를 들어 평가지표를 rmse로 하라고했는데 그냥 생략하고 잘 만들어겠지 하고 제출하려고합니다 어차피 랜덤포레스트 원툴인데 실전에서 기준점수가 뭔지도 모르고 이것저것 시도해서 점수를 높일 여유가 없을거같아서요 ㅠ

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
gamb21 댓글 2 좋아요 0 조회수 55

작업형 2 랜덤스테이트 질문있습니다

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 값들을 고정시키고자 랜덤스테이트 = 0의 작업을 한다고 배웠는데 그럼 혹시 실전에서 나는 랜덤포레스트 원툴로 간다 라고하면 랜덤스테이트 = 0 등을 안적어도 무방할까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
gamb21 댓글 2 좋아요 0 조회수 49

데이터 분리

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요 시간이 별로 없는 상태라 빅이시를 학습 중입니다. 빅이시에선 # 1. 데이터 전처리 target = train.pop('TravelInsurance') # ' '에는 예측할(타겟) 컬럼명 작성 train = pd.get_dummies(train) # train 문자형 컬럼 인코딩 (숫자로 변경) test = pd.get_dummies(test) 이렇게 하고 바로 머신러닝 모델 선택 후 학습을 진행하는데 꿀팁 섹션의 한가지 방법으로 풀기에서는 검증 데이터 분리를 추가로 수행하도록 되어 있더라구요 # 검증데이터 분리 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) 40점을 받기 위해서는 굳이 한가지 방법에 정리된 검증데이터 분리 코드를 사용하지 않아도 되는 것인가요 ?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
오승택 댓글 2 좋아요 0 조회수 79

카이제곱검정 관찰값, 기대값

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

카이제곱검정에서 관찰값과 기대값은 어떻게 구분하는게 안 헷갈릴까요? ㅜ

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
유조민 (유) 댓글 2 좋아요 0 조회수 91

머신러닝 학습 및 평가

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

기출 5회 제 2유형을 풀고 있는데요, 모델 성능의 평가 기준이 RMSE라고 되어 있어, from sklearn.metrics import root_mean_squared_error 을 import 하더라고요, 실제 시험장에서도 이 코드까지 제출해야하는건가요? 아니면 단순히 제출후에 모델 성능을 따로 판별할 수 없어서 혼자 모델성능을 비교해보기 위해, 이렇게 import를 하는건지 궁금합니다!

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
ryj0330 댓글 2 좋아요 0 조회수 41

시험 대비 점수 배점 궁금해요

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

작업형2, 작업형3을 만점 목표 + 작업형 1은 아는 것까지만 풀려고 합니다 완벽하게 풀면 물론 문제당 10점을 받겠지만, 최종적인 답을 못내도 중간까지만 코드를 작성해도 부분점수를 받을 수 있나요? all or nothing인지 궁금합니다 어렵게 내면 더 어렵게 낼 수 있겠지만 우선 인강에서 찝어주신 부분 위주로만 제대로 해서 가려고 합니다 감사합니다

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
yeommy00 댓글 2 좋아요 0 조회수 68

데이터프레임에서 일정 조건의 셀값 변경하는 방법

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요. 작업형 1관련하여 질문있습니다. 나올것 같지는 않기는 한데, 혹시 몰라서요. 지금까지는 fillna를 통해 결측값을 대치하는 명령어를 사용하였는데요. 예를 들어, 'abc(카테고리변수)', 'price(연속형)' 두개의 변수가 있다고 할때, abc 변수의 'a'인 값의 price가 잘못기입하여 기존값(abc 변수의 'a'값에 해당하는 'price' 값)의 1.1배를 해야 한다고 하면, 어떻게 코드를 작성하면 좋을까요? replace를 하기에는 변경해야할 변수 값이 많아서 어떻게 해야할지 궁금합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이승현 댓글 1 좋아요 0 조회수 51

기출 8회 작업형2 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

공지를 확인하였는데 궁금한 점이 있어 질문드립니다. 기출에서 컬럼을 삭제하는 경우가 없다 하셨는데 혹시 기출 8회에서도 컬럼 삭제 없이 문제를 풀 수가 있나요? 저는 아무리 해봐도 customerID 컬럼을 삭제하지 않으면 인코딩이 안 되어서요 ㅜㅜ 혹시 저는 원핫인코딩 하나로 밀고 나가고 있는데 공지는 레이블인코딩으로 진행하는 상황 기준인 걸까요..? 감사합니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
Jin 댓글 2 좋아요 0 조회수 46

스케일링 방법

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

안녕하세요! 최근 기출에는 작업형1에서 스케일링 문제가 안 나오는 걸로 알고 있는데, 스케일링에 대해서도 알아야 할까요?.....

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
s93610 댓글 2 좋아요 0 조회수 59

9회 작업형1 문제 이중포문으로 해결해도 되나요?

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

9회부터 작업형1이 갑자기 어려워진 것 같습니다. 기존에 알고 있던 걸로 풀리지 않아, 알고리즘 문제 풀듯이 2중포문을 사용해서 문제를 풀었습니다. 코랩에서는 바로 결과가 나오나, 구름에서 코드를 돌려보니 1분안에 결과가 안나오던데, 실제 시험장에서는 이렇게 문제를 풀어도 되는지 여쭤보고 싶습니다. 작업형1 2번 문제와 3번문제를 둘 다 이중포문으로 풀었습니다. 2번 코드 import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/9_1/crime.csv") # print(df) list(set(df['연도'])) # print(df.columns[2]) store = [] for i in range(0,len(df),2): rate = 0; name = '' for j in range(2,16): temp = df.iloc[i+1,j] / df.iloc[i,j] if temp > rate: rate = temp name = df.columns[j] store.append(name) print(store) cond_result = df['구분'] == '검거건수' df_result = df[cond_result].reset_index(drop = True) print(df_result) sum = 0 for i in range(7): sum = sum + df_result.loc[i,store[i]] print(sum) #7799 3번 코드 import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/9_1/hr.csv") print(df) # print(df.shape) # print(df.isnull().sum()) # print(df.head()) a = df['만족도'].mean() # print(a) df['만족도'] = df['만족도'].fillna(a) df_group = df.groupby(['부서', '성과등급'])['근속연수'].mean().reset_index() print(df_group) cond1 = df['근속연수'].isnull() df_null = df[cond1].drop(['사원번호', '연봉', '교육참가횟수', '만족도'], axis = 1).sort_values(['부서', '성과등급']) print(df_null) for i in range (len(df_null)): for j in range (len(df_group)): if (df_null.iloc[i,0] == df_group.iloc[j,0]) & (df_null.iloc[i,1] == df_group.iloc[j,1]): df_null.iloc[i,2] = int(df_group.iloc[j,2]) break; # df['근속연수'] print(df_null) print(df) df['근속연수'] = df['근속연수'].fillna(df_null['근속연수']) df['연봉/근속연수'] = df['연봉'] / df['근속연수'] print(df.sort_values('연봉/근속연수',ascending = False)) #1 df['연봉/만족도'] = df['연봉'] / df['만족도'] print(df.sort_values('연봉/만족도',ascending = False)) #6 print(1+6)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
chomin0514 댓글 2 좋아요 0 조회수 70

전처리 관련 문의

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

전처리 과정에서 꼭 ID 칼럼을 train과 test 둘다 제거해야하는건가요? 그대로 진행하면 안되는건지 여쭤보고 싶습니다.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
ryj0330 댓글 2 좋아요 0 조회수 55

[작업형2] 연습문제 섹션 1

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

인코딩하지 않고 분할로 바로 넘어간 이유를 설명해주세요.

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
댓글 3 좋아요 0 조회수 78

실행값?출력값 다름

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

왜 저는 앞에 np.float64가 붙을까요? 그 이후로 예측하는데 에러가 나요

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
ska2994 댓글 2 좋아요 0 조회수 72

test 예측 오류

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

왜 오류가 나는지 어떤 오류인지 모르겠어요..

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
ska2994 댓글 2 좋아요 0 조회수 61

머신러닝 파이프라인 단계 질문

미해결

머신러닝 엔지니어 실무

안녕하세요, 선생님. 일반적으로 머신러닝 파이프라인이 데이터 수집 및 버저닝 데이터 검증 데이터 전처리 모델 학습 이 순서로 진행된다고 이해하고 있습니다. 여기서 제가 헷갈리는 부분이 있어서 질문드립니다. 데이터 검증 범위 최초에 업로드된 raw 데이터 에 대해 1차 데이터 검증을 수행한 후, 전처리 과정을 거쳐 train / eval 데이터셋 이 생성된다고 알고 있습니다. 이때 전처리까지 마친 train / eval 데이터셋에 대해서도 한 번 더 데이터 검증을 수행하는 것이 일반적인 패턴인지 가 궁금합니다. 즉, 파이프라인 단계를 좀 더 세분화하면 아래와 같이 이해해도 되는지요? 1) 데이터 검증 (raw 데이터 기준) 2) 데이터 전처리 3) 전처리된 train / eval 데이터에 대한 2차 데이터 검증 4) 모델 학습 최초 학습 시점의 스키마와 서빙 데이터 검증 최초 학습 때 전처리된 파일로부터 train / eval 데이터셋 을 만들고, 이 데이터들에 대해 검증을 수행했다면, 이후 실제 서빙 단계에서 들어오는 serving 데이터 에 대해서는 최초 학습 시 사용한 train 데이터의 스키마/통계 정보를 기준으로 이상 유무를 판단하는 것이 맞는지 질문드립니다. 즉, - “최초 학습 시점: raw → 검증 → 전처리 →전처리 결과 검증 → 모델 학습” - “서빙 시점: 새로운 입력 데이터 → train 시점 스키마/통계 기준으로 검증 → 이상 없을 때만 모델에 입력” 이런 흐름이 일반적으로 사용하는 구조인지 궁금합니다. 정리하면, - 데이터 검증 → 전처리 → 전처리 결과에 대한 추가 검증 → 모델 학습 이라는 단계가 자연스러운지, - 그리고 서빙 데이터는 최초 학습 시점의 train 데이터 스키마/통계를 기준으로 검증하는 것이 맞는지 에 대해 설명해 주시면 감사하겠습니다.

  • 머신러닝
오세창 댓글 0 좋아요 0 조회수 67

인기 태그

인프런 TOP Writers

주간 인기글