불필요한 컬럼 삭제 시
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
특별한 기준이 있나요 ? 평가 지표에 따라 무조건 삭제해도 괜찮은 것인지.. 만약 중요한 변수라고 생각했으나 삭제하니 평가지표가 오른다거나 하면 어떻게 해야 하는지 궁금하네요.
- python
- 머신러닝
- 빅데이터
- pandas
- 빅데이터분석기사
172만명의 커뮤니티!! 함께 토론해봐요.
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
특별한 기준이 있나요 ? 평가 지표에 따라 무조건 삭제해도 괜찮은 것인지.. 만약 중요한 변수라고 생각했으나 삭제하니 평가지표가 오른다거나 하면 어떻게 해야 하는지 궁금하네요.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요, 선생님. 늦게나마 이번 실기 준비하고 있습니다! 항상 감사드려요! 해당 문제를 스스로 풀어 출력된 결과를 선생님의 결과와 비교하는 가운데, 다음과 같은 차이점이 있었습니다. 수치형 변수의 결측치를 mean 값으로 대체 유니크 값이 너무 많은 변수(Item_Identifier)를 삭제 위의 두 경우 제외 동일한 조건에서 레이블 인코더를 통한 인코딩(train, test 모두 범주형 변수 유니크 값이 동일하여 concat 진행 안함) lgbm 회귀보다 rf 회귀 모델이 RMSE 검증 결과 더 낮은 에러 값을 갖기에 rf 모델 선택 결과적으로 선생님과 근소한 차이로 RMSE 값이 조금 더 낮은 모델을 학습시킬 수 있었는데, 혹시 위의 과정 상 문제가 있는 것은 아닐지 걱정됩니다. 물론, 전처리 과정이나 변수 선택 등 코딩하는 사람에 따라 다를 수 있겠습니다만, 배우는 과정에서 선생님의 코드가 정석이기에 가급적 따라 배우려고 하는 마음에 오히려 좋은 결과를 의심하게 되네요. 번거롭게 해드려 죄송하면서 한편으로 항상 감사드립니다!
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
원핫 인코딩 (pd.get_dummies)를 사용하여 다중공선성을 제거 했을때, from statsmodels.formula.api import ols model = ols('매출액 ~ 광고비 + 유형_B + 유형_C', data=df).fit() print(model.summary()) 강의에서는 B와 C를 보는 경우만 보여주셨는데, 혹시 유형 A,B,C까지 다같이 보고 싶을때, model = ols('매출액 ~ 광고비 + 유형_A + 유형_B + 유형_C', data=df).fit() 이렇게 유형A도 포함시켜서 작성해야 하는지 문의드립니다! 추가로 기출이나 보통 A,B,C 전체 독립변수를 물어보는 경우가 자주 있는지 궁금합니다~!^^
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 예시문제가 시험 2주 전에 다 바뀌어서 당황스러운데 특히 3유형이 신유형 같아요 ㅠ 이걸 어떻게 대비해야할까요
미해결
[신규 개정판] 이것이 진짜 크롤링이다 - 실전편 (인공지능 수익화)
안녕하세요 스타트코딩님 쉬운 설명으로 틈틈히 그러나 열심히 공부중 입니다. 17강 RISS 파라미터 관련 동영상 6분쯤 되는 구글 개발자도구에서 파라미터 복사하는 부분인데요 isDetailSearch : N 가 아니라 isDetailSearch N 이렇게 되네요 혹시 코딩님 처럼 안되는 이유가 설정이 잘못된건지 방법이 따로 있는건지 궁금합니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 체험환경 예시문제가 싹 바뀌었어요ㅜㅜ 풀이 영상이 업로드 가능할까요..?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있 두번째할때가 제껀데 강의자료랑 비교했을때 행하고 열의 갯수가 다른데... 행은 전 행drop은 안하고해서 이해가 되도 열은 차이날수가있나요??
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 질문 두개 드립니다. 1) 데이터생성 불러오기 train = pd.read_csv('train_csv') 이런식으로 다 제공이 되는거지요? 2) 2유형 한가지방법으로 풀기의 경우, 원핫인코딩만 하셨는데, 하나만 해줘도되나요? 영상에서는 굳이 스케일링까지 안하셨길래,,, 안해줘도 되는거면 저야 땡큐지만, 성능개선이 필요한 상황이 발생한다면 민맥스 스케일러나 스탠다드 스케일링 해줘야하는건가요? 만약 성능개선을 위해서 스케일링 해야한다면, 시험환경에서 이미 성능 점수까지 확인한 후, 피쳐엔지니어링쪽 이후로 전부 주석처리해놓고 다시 처음부터 데이터 불러오고 EDA하다가 원핫인코딩하기 전까지 의 셀 쪽에 스케일링 진행하고, 나머지셀은 전부 실행하면되는건가요? ㅜㅜ 한마디로 pop하기전 원본데이터 처음부터 불러와서 피쳐엔지니어링 하기전까지의 단계에서 스케일링만 추가해준후 나머지 실행하면 성능개선이 되는건가요? 장황해서 죄송합니다
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
df['출동시간'] = pd.to_datetime(df['출동시간']) df['도착시간'] = pd.to_datetime(df['도착시간']) df.info() df['걸린시간(분)'] = df['도착시간'] - df['출동시간'] df['걸린시간(분)'] = df['걸린시간(분)'].dt.total_seconds() / 60 df.head(2) result = df.groupby('소방서')['걸린시간(분)'].mean() result # 여기서 result 말고 df 에 넣으면 오류뜨는데 이유를 모르겠음. result 말고 df 넣으면 오류뜨는데 이 기준을 잘 모르겠습니다..!
미해결
Next.js 까보기: "쓸 줄 아는 개발자"에서 "알고 쓰는 개발자"로
<리스트> <레코드1/> <레코드2/> </리스트> 일 경우… 리스트단에서 use client로 한 후 zustand에서 리스트 자체를 통으로 관리해야하는가? 각각의 레코드에 use client를 한 후 데이터를 받으면 zustand에 리스트를 만들어 레코드별로 hash(Map)으로 등록해 관리해야하는가? 레코드에는 좋아요, 조회수 등이 표시됨. 제 생각은 1번은 SEO가 중요한건 각각 레코드 (상세페이지) 이므로 zustand에서 통으로 넣어 관리하면 되니 구현 및 데이터 신뢰도에서는 나아보이는데 하나바뀌면 전부 렌더링되니까 애매한거같고 2번은 서버에서 모두 다 가져와서 초기속도는 빠르고 seo에 좋으나 zustand에 통으로 못넣고 데이터 자체를 내가 직접관리하는 구조라 구현 및 데이터 신뢰 측면에서는 골치아플거같은데… 무엇이 일반적인 구현방식인지 모르겠습니다. 도와주세요 ㅠㅠ
미해결
Next + React Query로 SNS 서비스 만들기
<리스트> <레코드1/> <레코드2/> </리스트> 일 경우… 리스트단에서 use client로 한 후 zustand에서 리스트 자체를 통으로 관리해야하는가? 각각의 레코드에 use client를 한 후 데이터를 받으면 zustand에 리스트를 만들어 레코드별로 hash(Map)으로 등록해 관리해야하는가? 레코드에는 좋아요, 조회수 등이 표시됨. 제 생각은 1번은 SEO가 중요한건 각각 레코드 (상세페이지) 이므로 zustand에서 통으로 넣어 관리하면 되니 구현 및 데이터 신뢰도에서는 나아보이는데 하나바뀌면 전부 렌더링되니까 애매한거같고 2번은 서버에서 모두 다 가져와서 초기속도는 빠르고 seo에 좋으나 zustand에 통으로 못넣고 데이터 자체를 내가 직접관리하는 구조라 구현 및 데이터 신뢰 측면에서는 골치아플거같은데… 무엇이 일반적인 구현방식인지 모르겠습니다. 도와주세요 ㅠㅠ
해결됨
한 입 크기로 잘라먹는 Next.js
<리스트> <레코드1/> <레코드2/> </리스트> 일 경우… 리스트단에서 use client로 한 후 zustand에서 리스트 자체를 통으로 관리해야하는가? 각각의 레코드에 use client를 한 후 데이터를 받으면 zustand에 리스트를 만들어 레코드별로 hash(Map)으로 등록해 관리해야하는가? 레코드에는 좋아요, 조회수 등이 표시됨. 제 생각은 1번은 SEO가 중요한건 각각 레코드 (상세페이지) 이므로 zustand에서 통으로 넣어 관리하면 되니 구현 및 데이터 신뢰도에서는 나아보이는데 하나바뀌면 전부 렌더링되니까 애매한거같고 2번은 서버에서 모두 다 가져와서 초기속도는 빠르고 seo에 좋으나 zustand에 통으로 못넣고 데이터 자체를 내가 직접관리하는 구조라 구현 및 데이터 신뢰 측면에서는 골치아플거같은데… 무엇이 일반적인 구현방식인지 모르겠습니다. 도와주세요 ㅠㅠ
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
빅분기 실기 강의와 같이 병행하려고 하는데 어떤식으로 같이 공부하는게 효과적일지 궁금합니다..!
해결됨
LangGraph를 활용한 AI Agent 개발 (feat. MCP)
안녕하십니까 선생님 강의 잘 듣고있습니다. 만약 create_react_agent에 tool이 vectordb retriever를 수행 할 때 retriever의 문서의 내용이 너무 많은 context를 가지고 있다면 llm이 리트리버한 결과를 바탕으로 질문에 대한 답변을 하지 않고 리트리버 문서를 요약해서 답변으로 출력합니다. 왜 그런건지 궁금합니다. from langgraph.prebuilt import create_react_agent @tool def retriever_tool(query: str)->List[Document]: """ 이 도구는 HR 데이터베이스에서 정보를 검색합니다. """ return retriever.invoke(query) tools = [retriever_tool] research_agent = create_react_agent( model = llm, tools = tools, prompt=(""), )
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요. 작업형2 지문에 보면 문제마다 아래와 같은 평가 지표들이 있는데. 여러 처리를 통해 평가지표가 높은 모델이나 처리등으로 수정을 하겠지만 혹시 해당 평가지표는 꼭 구하지 않아도 되는건지 궁금합니다. 즉, 해당 평가 지표는 구하지 않고 그냥 결과 파일(result.csv)만 제출하는 코드를 작성해도 되는건지요. 평가 지표: RMSE (Root Mean Squared Error) 평가 지표: ROC-AUC
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
원핫 인코딩만 하다가 지금 예시문제 작업형2를 풀다보니 ..카테고리 수가 많은건 레이블 인코딩을 해야할거같아서 해보는데 범주형컬럼에서 카테고리종류가 달라도 레이블인코딩으로 하면 문제가 없는것일까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 (sklearn.metrics) 이 패키지에 RMSE, RMSLE, MAPE 등 다 추가 됐다고 말씀하셨던 것 같은데 작업형2 모의문제2 에서는 직접 수식을 계산해야 한다고하셔서 혹시 어떤게 맞는건가요? 패키지에 추가 됐긴했는데 시험장에선 업데이트가 안됐다고 이해하면 될까요??
미해결
제로베이스부터 배우는 웹개발의 개념과 바이브 코딩
help 에서도 영어만 선택할 수 있게 나오고, 한국어 설정이 안보이네요. 어떻게 해결해야할까요
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
df = df.groupby(['month']).count() 이 풀이과정에서 count()대신 sum()은 왜 안되는 건가요~?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
다중분류 평가지표(f1_score) 에서 문자인 경우 pos_label = ' ' 을 적용해서 검증 자료에 대해 평가 결과를 확인하는데, 이후 test 자료를 저장할때는 문제에서 요구하는 히나의 값을 (A,B,C 중에서 B선택) 고르는게 아니라 pred로 왜 저장해야 하는지 긍금합니다~! 다중분류 평가지표(roc_auc) 에서 0,1,2 중에서 2를 선택해야 할 경우 pred_prob( , pred[ : ,2] ) 이렇게 2를 적용해야 되는것이 맞는지 문의드립니다~!