inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

172만명의 커뮤니티!! 함께 토론해봐요.

이해가 가지 않는 것

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

수치형 변수 스케일링을 할때 cols 에서 왜 TravelInsurance 는 제외시키나요? 그리고 display함수가 print함수와 다른 점은 무엇인가요? # 수치형 변수 스케일링 from sklearn.preprocessing import RobustScaler scaler = RobustScaler() cols = ['Age','AnnualIncome','FamilyMembers','ChronicDiseases'] display(a_train.head()) a_train[cols] = scaler.fit_transform(a_train[cols]) a_test[cols] = scaler.transform(a_test[cols]) a_train.head()

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김라의 댓글 1 좋아요 0 조회수 80

T2-1. 타이타닉(Titanic) Simple Baseline 질문있습니다

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

# 시험환경 세팅 (코드 변경 X) import pandas as pd import numpy as np from sklearn.model_selection import train_test_split def exam_data_load(df, target, id_name="", null_name=""): if id_name == "": df = df.reset_index().rename(columns={"index": "id"}) id_name = 'id' else: id_name = id_name if null_name != "": df[df == null_name] = np.nan X_train, X_test = train_test_split(df, test_size=0.2, random_state=2021) y_train = X_train[[id_name, target]] X_train = X_train.drop(columns=[target]) y_test = X_test[[id_name, target]] X_test = X_test.drop(columns=[target]) return X_train, X_test, y_train, y_test df = pd.read _csv("../input/titanic/train.csv") X_train, X_test, y_train, y_test = exam_data_load(df, target='Survived', id_name='PassengerId') #print(X_train.shape, X_test.shape, y_train.shape, y_test.shape) X_train = X_train.drop(['Cabin','Name','Ticket'],axis=1) X_test = X_test.drop(['Cabin','Name','Ticket'],axis=1) X_train['Age']=X_train['Age'].loc[X_train['Age']>=1] X_train['Age']=X_train['Age'].fillna(X_train['Age'].mean()) X_test['Age']=X_test['Age'].loc[X_test['Age']>=1] X_test['Age']=X_test['Age'].fillna(X_test['Age'].mean()) X_train['Embarked']=X_train['Embarked'].fillna(X_train['Embarked'].mode()[0]) X_test['Embarked']=X_test['Embarked'].fillna(X_test['Embarked'].mode()[0]) cond=pd.get_dummies(X_train['Sex']) cond2=pd.get_dummies(X_test['Sex']) X_train['female']=cond.iloc[:,0] X_train['male']=cond.iloc[:,1] X_test['female']=cond2.iloc[:,0] X_test['male']=cond2.iloc[:,1] X_train = X_train.drop('Sex',axis=1) X_test = X_test.drop('Sex',axis=1) from sklearn.preprocessing import LabelEncoder le=LabelEncoder() cols=['Embarked'] for col in cols: le = LabelEncoder() X_train[col]= le.fit _transform(X_train[col]) X_test[col]=le.transform(X_test[col]) from sklearn.model_selection import train_test_split X_tr,X_val,y_tr,y_val=train_test_split(X_train,y_train['Survived'],test_size=0.2,random_state=42) from sklearn.metrics import accuracy_score from sklearn.ensemble import RandomForestClassifier model = RandomForestClassifier(random_state=42) model.fit (X_tr,y_tr) pred = model.predict(X_val) accuracy_score(y_val,pred) pred=model.predict(X_test) submit = pd.DataFrame( { 'PassengerId' : X_test['PassengerId'], 'Survived' : pred } ) submit.to _csv("003000000.csv",index=False) submit.head() pd.read _csv("/kaggle/working/003000000.csv") accuracy_score(y_test['Survived'],submit['Survived']) 베이스라인 안보고 혼자 해봤습니다. 이렇게 작성했는데 마지막줄에서 점수는 나오는데 타이타닉 캐글 대회에는 제출이 안되서요 혹시 어느부분이 잘못된건지 알수있을까요?? 그리고 이렇게 실행해도 맞는건지도 답변 부탁드립니다

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
현우 댓글 1 좋아요 0 조회수 75

작업형 모의문제 2

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

작업형 결측치 포함된 columns들 삭제하는 과정에서, 영상에서는 host_id는 결측치가 존재하지 않는데 drop으로 삭제하였습니다. 따로 이유가 있는걸까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
hong8265 댓글 2 좋아요 1 조회수 79

32. 캐글(kaggle) 필사 전략 수업 노트

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

32. 캐글(kaggle) 필사 전략 강의에서 노션 정리하신 것을 수업 노트에 올려 주신다고 하셨는데, 확인이 안되어 문의드립니다! (18:10)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
선영 댓글 2 좋아요 0 조회수 66

신규 버전 강의 업데이트 예정일

미해결

Airflow 마스터 클래스

안녕하세요, 최근에 airflow를 공부해보려고 해당 인강을 구매했는데, airflow3버전 인강 업데이트 예정이라는 공지를 보고, 대기 중에 있습니다. 혹시 언제쯤 업데이트 될 예정인지 알 수 있을까요? 아니면 우선 airflow2 버전으로라도 보는게 나을까요?

  • python
  • 데이터-엔지니어링
  • airflow
jwkim 댓글 1 좋아요 0 조회수 98

groupby()안 괄호 관련

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

첫 번째, 두 번째 둘 다 groupby(컬럼명)했는데 왜 첫번째는 에러가 나고 두번째는 정사적으로 작동하나요??

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김대현 댓글 3 좋아요 0 조회수 92

작업형1 모의문제 3 문제7번

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

인덱스 값이 2001인 데이터(행)을 선택할 때 df.loc[2001] df.loc[2001].mean() loc 대신 df.iloc[1,:].mean() 위처럼 iloc 함수를 사용해도 되나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
최수영 댓글 2 좋아요 0 조회수 75

roc_auc 결과 값 문의

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세 위와 같이 실행했는데 baseline roc_auc가 높게 나옵니다 그리고 y_test 실행결과 label과 점수가 비슷합니다. 어떤 이유일때문일까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
빅분기실기가즈아 댓글 2 좋아요 0 조회수 65

9회 기출유형 원본파일 관련 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

선생님 9회 기출유형 원본파일은 깃허브상에 없던데 업데이트 예정인가요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
diadia1189 댓글 2 좋아요 0 조회수 77

이해가 가지 않는 것

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강의를 보면서 강사님과 똑같이 진행을 하는데 값이 다릅니다. 그리고 영상에서는 max_depth를 설정했을 때가 설정하지 않았을 때 보다 값이 더 올라갔는데 저 같은 경우는 설정한 후 값이 더 내려갔습니다. 정상적인 건가요? #rf from sklearn.ensemble import RandomForestClassifier from sklearn.metrics import roc_auc_score, f1_score, accuracy_score rf = RandomForestClassifier(random_state=2025,max_depth=3) rf.fit(X_tr,y_tr) pred = rf.predict(X_val) pred_proba = rf.predict_proba(X_val) print(roc_auc_score(y_val,pred_proba[:,1])) print(f1_score(y_val,pred)) print(accuracy_score(y_val,pred)) # 0.9227272727272727 # 0.8571428571428571 # 0.8378378378378378 # max_depth = 3 # 0.9242424242424243 # 0.8 # 0.7837837837837838

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김라의 댓글 3 좋아요 0 조회수 89

이해가 가지 않는 것

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

roc_auc_score, f1_score, accuracy_score를 구할때 print문의 y_val,pred를 넣는데 왜 저 2가지를 넣는건가요? 그리고 proba는 뭔가요? print(roc_auc_score(y_val,pred_proba[:,1])) print(f1_score(y_val,pred)) print(accuracy_score(y_val,pred))

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김라의 댓글 2 좋아요 0 조회수 84

이해가 가지 않는 것

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

<모델&평가>에서 fit(학습)을 시킬때는 왜 X_tr,y_tr을 넣고 예측을 할때는 왜 X_val를 넣나요 ? 그냥 아무거나 넣어도 되나요 ? #rf from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=2025) rf.fit(X_tr,y_tr) pred = rf.predict(X_val)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김라의 댓글 2 좋아요 0 조회수 78

이해가 가지 않는 것

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

<데이터 전처리 &피처엔지니어링>에서 왜 id를 drop 하나요? 그리고 <검증 데이터 분리>에서 는 왜 output을 drop 하나요? train = train.drop('id',axis=1) test_id = test.pop('id') test.head() from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train.drop('output',axis=1),train['output'],test_size=0.15, random_state=2025)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김라의 댓글 2 좋아요 0 조회수 80

단위테스트와 통합테스트의 경계가 궁금합니다.

미해결

Practical Testing: 실용적인 테스트 가이드

안녕하세요 우빈님 강의 너무나 잘 듣고 있습니다 🙂 주니어에게 큰 힘이 되고 있습니다 감사합니다 공부를 하다보니 단위테스트와 통합테스트의 경계가 궁금하게 되었습니다. 우빈님은 컨트롤러 / 서비스 / 리포지토리 각 계층에 대해 단위 / 통합 / 단위 테스트라고 구분하셨는데요 어떤 분은 컨트롤러 계층에서 작성한 테스트에 대해 통합테스트라고 주장하셨습니다 @WebMvcTest 또는 @SpringBootTest를 사용해 스프링 컨텍스트의 일부(웹 계층) 또는 전체를 로드해야 한다. 진정한 단위 테스트"는 스프링이나 다른 컨테이너 없이 new 연산자를 사용하여 객체를 인스턴스화하고 테스트하는 것을 의미한다고 하셨습니다. 테스트 대상 범위: 또한 테스트는 특정 컨트롤러 메서드의 로직만을 격리하여 테스트하는 것이 아니라, 특정 URL에 대한 HTTP 요청이 스프링 웹 계층을 통과하여 컨트롤러에 도달하고, 컨트롤러의 응답이 HTTP 응답으로 변환되어 반환되는 전체 과정 중 일부를 시뮬레이션하고 검증하는 관점에서 통합테스트다 라고 주장하셨습니다. 정확한 구분은 어떻게 해야할까요? 사실 이러한 구분이 중요한가 고민도 됩니다. 어차피 테스트에 대한 목적과 경계 설정을 구분하는 것이 중요하지 않은가 싶긴 한데 우빈님 의견이 궁금합니다.

  • spring
  • tdd
  • jpa
  • mockito
  • 소프트웨어-테스트
  • junit5
rlamw2000 댓글 2 좋아요 0 조회수 286

라소,릿지 gridsearchcv에서 알파값관련

미해결

[개정판] 파이썬 머신러닝 완벽 가이드

알파값을 릿지는 0.05,0.1,1,5,8,10,12,15,20 라소는 0.001,0.005------ 이렇게 잡는 이유와 기준이 무엇인지? 그냥 경험치인건지

  • python
  • 머신러닝
  • 통계
kccjjang 댓글 2 좋아요 0 조회수 147

작업형1 모의문제 1 문제 3번

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

# your code import pandas as pd df = pd.read_csv("members.csv") df.head() #views 컬럼에 결측치가 있는 데이터(행)을 삭제하고 df.isnull().sum() #views에 결측치 4개 # print(df.shape) df = df.dropna(subset = ['views']) # print(df.shape) #f3 컬럼의 결측치는 0, silver는 1, gold는 2, vip는 3 으로 변환한 후 총 합을 정수형으로 출력하시오 df['f3'] = df['f3'].fillna(0) df['f3'] = df['f3'].replace('silver', 1) df['f3'] = df['f3'].replace('gold', 2) df['f3'] = df['f3'].replace('vip', 3) # print(df.head(20)) print(int(df['f3'].sum())) numpy 안 쓰고 이렇게 작성해도 되나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
최수영 댓글 2 좋아요 0 조회수 65

작업형1 모의문제1 _ 문제 1에서

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

3사분위수 - 1사분위 수 값을 구할 때 선생님 처럼 r2, r1 변수 안 만들고 df = df[:int(len(df) * 0.7)] #70% 데이터 선택 IOQ = df['views'].quantile(.75) - df['views'].quantile(.25) print(IOQ) 이렇게 구해도 되나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
최수영 댓글 2 좋아요 0 조회수 62

Service+Repository 통합테스트 관련 질문입니다.

미해결

Practical Testing: 실용적인 테스트 가이드

요즘 서비스 계층 단위테스트를 위해 모킹과 fake 객체 구현을 공부하고 있습니다. 하지만 레포지토리를 일일이 모킹하는 코드를 작성하는 것이 빠른 피드백이 장점인 단위테스트로 의미가 있는지 의문이 들 정도로 시간이 많이 들더라고요. 그래서, 좀 더 효율적인 강사님의 방식을 따라가고 싶어 강의를 듣던 중 의문이 생겨서 질문드립니다. 1. 계층별 테스트 분리 기준에 대한 질문입니다. 컨트롤러, 레포지토리는 단위테스트, 서비스 계층은 레포지토리 부분과 통합테스트 이렇게 분리해서 진행하셨던 이유를 여쭤봐도 될까요? 서비스, 컨트롤러, 레포지토리 계층 각각 단위테스트를 작성하고 컨트롤러에서 레포지토리까지 한번 통합테스트를 작성하는 방법도 있을 것 같고, 묶어볼 방법은 몇 가지 더 있는 것 같습니다. 그런데 강의에서처럼 분리했던 게 가장 효율적이라고 생각하는 기준과 이유…. 이 분리 방식의 발견 과정이 너무 궁금하네요 2. 통합테스트 DB 관련 질문입니다. 서비스계층과 레포지토리 계층을 묶은 상태로 H2 같은 임베디드 데이터베이스를 사용하면 테스트 속도가 상당히 느리게 나오긴 합니다. 이런 부분은 어쩔 수 없이 안고 가는 것인가요? 그리고 운영이나 개발 DB를 postgress같이 H2말고 다른 걸 사용한다고 해도, H2로 통합테스트 테스트하는게 이점이 있을까요? 3. 서비스 계층 단위테스트 관련 질문입니다. 혹시, 부담이 안 된다면, 서비스 계층의 단위테스트가 중요도가 많이 떨어진다고 생각하시는 이유가 Fake든 Mockito를 사용한 Stub이든 데이터베이스를 흉내만 내는 테스트가 의미가 없다고 여기셔서 그런 것일까요? 부족한 질문 읽어주셔서 감사합니다!

  • spring
  • tdd
  • jpa
  • mockito
  • 소프트웨어-테스트
  • junit5
hwang99 댓글 2 좋아요 0 조회수 191

기출8회 제2유형

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

제가 푼 내용을 보면 pred = rf.predict(test) : 질문자 pred = rf.predict(x_val) : 해설 위 두가지가 다릅니다. 해당 건 때문에 pred 했을 때, 값 차이가 많이 나는건가요? ㅜ_ㅠ 챗gpt에 물어보니 어떨때는 test고 어떨대는 x_val인지 아직도 모르겠습니다. # 라이브러리 및 데이터 불러오기 import pandas as pd train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_test.csv") # train.info() # test.info() target = train.pop('TotalCharges') train = pd.get_dummies(train) test = pd.get_dummies(test) train, test = train.align(test, join='left', axis=1) from sklearn.model_selection import train_test_split x_tr, x_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state=0) rf.fit(x_tr, y_tr) pred = rf.predict(test) submit = pd.DataFrame({'pred' : pred}) submit.to_csv('result.csv', index=False) ans = pd.read_csv('result.csv') print(ans)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
wlysh999 댓글 2 좋아요 0 조회수 75

인기 태그

인프런 TOP Writers

주간 인기글