inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

묻고 답해요

172만명의 커뮤니티!! 함께 토론해봐요.

roc_auc 결과 값 문의

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세 위와 같이 실행했는데 baseline roc_auc가 높게 나옵니다 그리고 y_test 실행결과 label과 점수가 비슷합니다. 어떤 이유일때문일까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
빅분기실기가즈아 댓글 2 좋아요 0 조회수 65

3.2.1 Upstage 로 embedding 하실때에 typeError..

미해결

RAG를 활용한 LLM Application 개발 (feat. LangChain)

3.2.1 OpenAIEmbeddings 대신 UpstageEmbeddings를 활용하는 방법 으로 실습 예제 하고 있는데요 기존 예제로 하면 chain_type 이 없이 동영상자료에서는 그대로 실행되었는데, 실제로 해보니 chain_type 이 2번째로 와야 하는데 없어서 오류가 뜨더라구요,... 아래는 동영상에서 실행되는 코드 입니다. from langchain.chains import RetrievalQA qa_chain = RetrievalQA.from_chain_type( llm, retriever=database.as_retriever(), chain_type_kwargs={"prompt": prompt} ) TypeError Traceback (most recent call last) Cell In[17], line 3 1 from langchain.chains import RetrievalQA ----> 3 qa_chain = RetrievalQA.from_chain_type( 4 llm, 5 database.as _retriever(), 6 chain_type_kwargs={"prompt":prompt} 7 ) 가 뜨게 되는데 확인해 보니, from langchain.chains import RetrievalQA qa_chain = RetrievalQA.from_chain_type( llm=llm, chain_type="stuff", # 기본 체인 타입 (원하면 "map_reduce"도 가능) retriever=database.as_retriever(), chain_type_kwargs={"prompt": prompt} ) chain_type 이 빠져서 안돌아 가더라구요.. chain_type 을 넣어주면 잘 돌아갑니다. 혹시나 저처럼 헤메이실 분을 위해 올려둡니다. OpenAI 유료결제 안하는 바람에 Upstage로 따라해보려고 하는데... 앞으로의 강의는 OpenAI 로 작성되는것 같아서 유료결제를 해야 할까요...?? 그리고 로컬 Ollama 로 하는 영상도 시간 나시면 올려주시면 좋겠어요~^^ 덕분에 langChain 의 l 도 모르던 제가 따라하게 되네요 좋은 영상 감사합니다.

  • vector-database
  • llm
  • langchain
  • rag
  • openai-api
요조 댓글 1 좋아요 0 조회수 149

9회 기출유형 원본파일 관련 질문

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

선생님 9회 기출유형 원본파일은 깃허브상에 없던데 업데이트 예정인가요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
diadia1189 댓글 2 좋아요 0 조회수 77

이해가 가지 않는 것

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

강의를 보면서 강사님과 똑같이 진행을 하는데 값이 다릅니다. 그리고 영상에서는 max_depth를 설정했을 때가 설정하지 않았을 때 보다 값이 더 올라갔는데 저 같은 경우는 설정한 후 값이 더 내려갔습니다. 정상적인 건가요? #rf from sklearn.ensemble import RandomForestClassifier from sklearn.metrics import roc_auc_score, f1_score, accuracy_score rf = RandomForestClassifier(random_state=2025,max_depth=3) rf.fit(X_tr,y_tr) pred = rf.predict(X_val) pred_proba = rf.predict_proba(X_val) print(roc_auc_score(y_val,pred_proba[:,1])) print(f1_score(y_val,pred)) print(accuracy_score(y_val,pred)) # 0.9227272727272727 # 0.8571428571428571 # 0.8378378378378378 # max_depth = 3 # 0.9242424242424243 # 0.8 # 0.7837837837837838

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김라의 댓글 3 좋아요 0 조회수 90

이해가 가지 않는 것

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

roc_auc_score, f1_score, accuracy_score를 구할때 print문의 y_val,pred를 넣는데 왜 저 2가지를 넣는건가요? 그리고 proba는 뭔가요? print(roc_auc_score(y_val,pred_proba[:,1])) print(f1_score(y_val,pred)) print(accuracy_score(y_val,pred))

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김라의 댓글 2 좋아요 0 조회수 84

이해가 가지 않는 것

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

<모델&평가>에서 fit(학습)을 시킬때는 왜 X_tr,y_tr을 넣고 예측을 할때는 왜 X_val를 넣나요 ? 그냥 아무거나 넣어도 되나요 ? #rf from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=2025) rf.fit(X_tr,y_tr) pred = rf.predict(X_val)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김라의 댓글 2 좋아요 0 조회수 78

이해가 가지 않는 것

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

<데이터 전처리 &피처엔지니어링>에서 왜 id를 drop 하나요? 그리고 <검증 데이터 분리>에서 는 왜 output을 drop 하나요? train = train.drop('id',axis=1) test_id = test.pop('id') test.head() from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train.drop('output',axis=1),train['output'],test_size=0.15, random_state=2025)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
김라의 댓글 2 좋아요 0 조회수 80

라소,릿지 gridsearchcv에서 알파값관련

미해결

[개정판] 파이썬 머신러닝 완벽 가이드

알파값을 릿지는 0.05,0.1,1,5,8,10,12,15,20 라소는 0.001,0.005------ 이렇게 잡는 이유와 기준이 무엇인지? 그냥 경험치인건지

  • python
  • 머신러닝
  • 통계
kccjjang 댓글 2 좋아요 0 조회수 147

작업형1 모의문제 1 문제 3번

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

# your code import pandas as pd df = pd.read_csv("members.csv") df.head() #views 컬럼에 결측치가 있는 데이터(행)을 삭제하고 df.isnull().sum() #views에 결측치 4개 # print(df.shape) df = df.dropna(subset = ['views']) # print(df.shape) #f3 컬럼의 결측치는 0, silver는 1, gold는 2, vip는 3 으로 변환한 후 총 합을 정수형으로 출력하시오 df['f3'] = df['f3'].fillna(0) df['f3'] = df['f3'].replace('silver', 1) df['f3'] = df['f3'].replace('gold', 2) df['f3'] = df['f3'].replace('vip', 3) # print(df.head(20)) print(int(df['f3'].sum())) numpy 안 쓰고 이렇게 작성해도 되나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
최수영 댓글 2 좋아요 0 조회수 65

작업형1 모의문제1 _ 문제 1에서

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

3사분위수 - 1사분위 수 값을 구할 때 선생님 처럼 r2, r1 변수 안 만들고 df = df[:int(len(df) * 0.7)] #70% 데이터 선택 IOQ = df['views'].quantile(.75) - df['views'].quantile(.25) print(IOQ) 이렇게 구해도 되나요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
최수영 댓글 2 좋아요 0 조회수 62

기출8회 제2유형

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

제가 푼 내용을 보면 pred = rf.predict(test) : 질문자 pred = rf.predict(x_val) : 해설 위 두가지가 다릅니다. 해당 건 때문에 pred 했을 때, 값 차이가 많이 나는건가요? ㅜ_ㅠ 챗gpt에 물어보니 어떨때는 test고 어떨대는 x_val인지 아직도 모르겠습니다. # 라이브러리 및 데이터 불러오기 import pandas as pd train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_test.csv") # train.info() # test.info() target = train.pop('TotalCharges') train = pd.get_dummies(train) test = pd.get_dummies(test) train, test = train.align(test, join='left', axis=1) from sklearn.model_selection import train_test_split x_tr, x_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state=0) rf.fit(x_tr, y_tr) pred = rf.predict(test) submit = pd.DataFrame({'pred' : pred}) submit.to_csv('result.csv', index=False) ans = pd.read_csv('result.csv') print(ans)

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
wlysh999 댓글 2 좋아요 0 조회수 75

6번 질문입니다

미해결

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

'age' 컬럼의 이상치(소수점 나이와 음수나이, 0포함)를 제거하고 제거 전 후의 views 컬럼 표준편차를 더하시오 (최종 결과 값은 소수 둘째자리까지 출력, 셋째자리에서 반올림) 제가 생각한 이상치 제거는 1. 사분위수를 이용해서 1차적으로 이상치를 제거하고 1번을 통해 필터링 된 데이터에서 0, 음수, 소수 데이터를 제거 라고 생각했는데 아닌가요? 답은 우연인지 의도인지 둘다 8420.69 이 나오긴 했습니다 import pandas as pd df = pd.read _csv( " https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv " ) bef = df[ 'views' ].std() #1 #0, 음수 제거 -> 소수 제거 # opt6_1 = df['age'] <= 0 # df= df[~opt6_1] # opt6_2 = df['age'] % 1 == 0 # df = df[opt6_2] # aft = df['views'].std() # print(round(bef+aft, 2)) ###### 8420.69 출력 #2 # 이상치 제거 -> 0,음수 제거 -> 소수제거 Q1 = df[ 'age' ].quantile( 0.25 ) Q3 = df[ 'age' ].quantile( 0.75 ) IQR = Q3 - Q1 cond1 = df[ 'age' ] > Q3 + ( 1.5 * IQR) df = df[~cond1] cond2 = df[ 'age' ] < Q1 - ( 1.5 * IQR) df = df[~cond2] cond3 = df[ 'age' ] <= 0 df = df[~cond3] cond4 = df[ 'age' ] % 1 == 0 df = df[cond4] aft = df[ 'views' ].std() print ( round (aft + bef, 2 )) ###### 8420.69 출력

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
홍상환 댓글 1 좋아요 0 조회수 55

gtts 에러

해결됨

[AI] 프롬프트만으로 아이디어 구현하기_바이브코딩 입문

아래 질문 대댓글로 올렸는데, 잘 못보실것같아 이곳에 정식으로 올립니다. 모든 프로그램 설치 후, 재부팅, 커서 재실행등은 다 해봤습니다. ============================= 처음 코드를 만들고 gtts에서 에러가 나네요. 선생님의 코드 요청과 똑같이 요청을 했고, 그래서 아래와 같은 코드가 생성되었습니다. 그래서 pip install -r requirements.txt 를 터미널에 입력 시켜주었으며 위와 같이 제대로 설치가 된것 같습니다. requirements.txt 내용 -> gTTS==2.3.2 그랬는데 아래와 같이 Python cmd창에서 에러가 납니다. (대소문자 에러인줄알고 그마저도 고쳤는데도) gtts가 설치가 된것 같은데 왜 불러오질 못하는지 모르겠네요 ㅠㅠ(참고로 코알못입니다) 커서도 여러번 껐다가 재실행했는데도 꼭 저러네요.. 이것저것 만져보기도 겁다고한데... 해결 방법 좀 알려주시면 감사하겠습니다.! ======= 혹시 추가 정보가 필요하신게 있으면 알려주시면 바로 확인해서 올리겠습니다.

  • python
  • 업무-생산성
  • 인공지능(ai)
kelo 댓글 2 좋아요 0 조회수 212

데이터 50퍼센트 추출 코드에서

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

len함수로 세서 나누기 2를 하는 코드로 알려주셨는데 len(df)*0.5) 이렇게 작성해도 될까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이선희 댓글 2 좋아요 0 조회수 117

views의 세번째로 큰 도시를 구할때?

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

풀이과정에서 iloc로 views가 세번째로 큰 도시를 출력해내는데 실제 시험에서는 정답만 기입하면 되는데 혹시 iloc로 구하지않고 육안으로 답을 알아보면 굳이 저렇게 까지 진행하지 않아도 될까요? 아니면 출력하는 마지막 코드까지 완성을 해둬야 하는걸까요?

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
이선희 댓글 2 좋아요 0 조회수 59

사이킷런을 이용한 GMM 군집화 실습 강의 중 질문입니다.

미해결

[개정판] 파이썬 머신러닝 완벽 가이드

안녕하세요 사이킷런을 이용한 GMM 군집화 실습 강의 중 질문입니다. 9:15 에서 transformation = [[0.60834549,-0.63667341],[-0.40887717,0.85253229]] 로 설정하면 된다고 하셨는데 이 값들은 어디서 도출된 값인가요? 이 부분은 자세한 설명 없이 바로 다음 부분으로 넘어가시는데요, 이 값들이 어떻게 도출된 값들인지 자세한 설명 부탁드립니다

  • python
  • 머신러닝
  • 통계
박종성 댓글 1 좋아요 0 조회수 85

id컬럼 삭제

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

test_id=test['id'] test = test.drop(['id'],axis=1) 이렇게 해도 괜찮나요??

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
현우 댓글 2 좋아요 0 조회수 55

작업형 2 질문드립니다.

해결됨

[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)

결과가 이런식으로 나오면 성공한건가요?? 추가로 id컬럼 정렬이나 y_test 비교 roc 점수가 88%면 합격일지도 궁금합니다 ㅠ

  • python
  • 머신러닝
  • 빅데이터
  • pandas
  • 빅데이터분석기사
현우 댓글 2 좋아요 0 조회수 62

인기 태그

인프런 TOP Writers

주간 인기글