캐글 문제 정리본 수업노트에 없어요
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
캐글 문제 정리본 수업노트에 없어요. 올려주세요.
- python
- 머신러닝
- 빅데이터
- pandas
- 빅데이터분석기사
172만명의 커뮤니티!! 함께 토론해봐요.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
캐글 문제 정리본 수업노트에 없어요. 올려주세요.
해결됨
6주 완성! 백엔드 이력서 차별화 전략 4가지 - 똑같은 이력서 속에서 돋보이는 법
1. 현재 학습 진도 몇 챕터/몇 강을 수강 중이신가요? 3-9강 여기까지 이해하신 내용은 무엇인가요? B+Tree 작동 원리, INDEX 생성 2. 어려움을 겪는 부분 select o1_0.id, o1_0.created_at, o1_0.member_id, o1_0.order_date, o1_0.order_number, o1_0.status, o1_0.total_amount, o1_0.updated_at from ch3_orders o1_0 where o1_0.order_date>='2023-01-01T00:00' and o1_0.status= 'COMPLETED' and o1_0.total_amount>=500 order by o1_0.order_date desc; 위와 같은 쿼리를 실행할 때, INDEX의 첫번째 필드를 date로 하였을 때, date의 정렬 방식에 따라서 속도가 달라지는 이유가 궁금합니다. (즉, 아래처럼 2가지 방식의 INDEX) CREATE INDEX ids_order_date_status_amount ON ch3_orders(order_date desc, status, total_amount); CREATE INDEX ids_order_date_status_amount ON ch3_orders(order_date, status, total_amount); 날짜 기준으로 최신 데이터를 100개 가져오는 쿼리를 실행시켰을 때, B+Tree의 leaf 노드에서는 양방향으로 이동할 수 있기 때문에 date가 ASC 정렬된 상태에서 역방향으로 읽어 최신 데이터를 읽으나, DESC 정렬된 상태에서 순방향으로 읽어 가져오나 읽는 노드의 수는 동일하다고 생각이 듭니다. 실제로 date를 각각의 정렬조건으로 INDEX를 만들어서 실제로 실행을 시켰을 때에도 거의 차이가 존재하지 않았습니다. (데이터가 많지 않아서 그런지는 모르겠습니다...) 하지만 제가 시도 한 내용이 맞는지 잘 모르겠습니다. 3. 시도해보신 내용 ASC, DESC 정렬을 시킨 INDEX를 사용하여 analyze 한 결과입니다. Limit: 100 row(s) (cost=50413 rows=100) (actual time=0.874..0.899 rows=100 loops=1) -> Index range scan on o1_0 using ids_order_date_status_amount over ('2023-01-01 00:00:00.000000' <= order_date AND 'COMPLETED' <= status AND 500 <= total_amount)... Limit: 100 row(s) (cost=50413 rows=100) (actual time=0.43..0.446 rows=100 loops=1) -> Index range scan on o1_0 using ids_order_date_status_amount over (order_date <= '2023-01-01 00:00:00.000000' AND status <= 'COMPLETED'), with index condition: (... 1번은 ASC로 정렬한 INDEX입니다. 2번은 DESC로 정렬한 INDEX입니다. 여기에서 desc로 정렬한 acutal time이 거의 2배 빨라진 것을 확인 할 수 있습니다. analyze가 정확한 값을 알려주지 않을 수도 있다는 사실을 알고 있지만, 제가 판단한 내용이 맞는지 의심이 듭니다. 딩코딩코님도 desc로 정렬을 하신거 보면 이유가 있을 것이라고도 생각합니다. Q1. 위 상황에서 INDEX의 첫번째 칼럼은 정렬 조건이 의미가 없는 게 맞나요? Q2. 만약 의미가 있다면 어떤 부분에서 의미가 있는지 궁금합니다.
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
5회기출문제 작업형2에서 평가지표가 RMSE가 나왔는데 다른 평가지표를 사용해도 무방하다고 하셔서 MSE로 작업을 해봤어요 그런데 결과값이 너무 크게 차이가 나는데 상관없나요? 값이 작을수록 좋다고 하셔셔.. ㅜ 만약 시험에서 RMSE로 나올경우 , 대신 쓸 수 있는 평가지표를 추천해주세요
미해결
확률과 통계 101
25장 중심극한정리에서 동전 던지기 실험에서 분산을 구할때 분모를 n으로 나웠는데요. 분모가 표본에 대한 거니 n-1이 맞이 않나요?
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 문제 7번에서 index '2001' 데이터(행)의 평균보다 큰 값의 갯수와 index '2003' 데이터(행)의 평균보다 작은 값의 갯수를 더하시오 위 말이 2001의 데이터행의 평균과 2001의 데이터를 비교해서 큰 값인지 df내 전체 데이터와 비교하라는 것인지 비교군이 명확하지 않아 혼동이 옵니다. 설명 영상을 보고서야 같은 행에 대한 비교란 것을 알았습니다. 아래 2003도 마찬가지고요
해결됨
한 입 크기로 잘라먹는 Next.js
안녕하세요, 강의 정말 잘 수강하고 있습니다. 강의 수강 중에 궁금한 점이 생겨 질문 드립니다. 강사님께서 말씀하신 것처럼 규모가 크고 복잡한 프로젝트의 경우는 컴포넌트의 양이 많아, 개발자가 이를 인지하지 못 하고 클라이언트 컴포넌트 아래에 서버 컴포넌트를 사용하는 경우가 자주 발생할 수 있을 것 같다는 생각이 들었습니다. 그렇다면 혹시 큰 프로젝트 내에서 이를 방지하기 위해 특별히 조치를 취하셨던 경험이나 팁이 있는지 알고 싶어서 질문드립니다. 예를 들면, 서버 컴포넌트와 클라이언트를 다른 폴더로 구분해서 분류하는 등 실무에서 실제로 사용되는 방법이 있는지 알려주시면 감사하겠습니다!
해결됨
[실습] 대기업 근무하며 경험한 Redis를 야무지게 사용하기
안녕하세요. 좋은 강의 감사합니다. 강의 도중 StringModel을 구현하실 때 Key를 String type 필드로 선언하시는데, key-value 구조에서 왜 value에도 key를 다시 저장하는지 의도가 궁금하여 문의 드립니다!
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
샤피로 검정하는 이유가 정규성을 충족하는지를 확인하기 위해 하는거라고 이해했는데 질문있습니다. 만약 pvalue가 0.05보다커서정규성을 충족한다면 ttest로 하면 되나요? 코드처럼 샤피로검정에서 pvalue가 0.05보다 낮으면 정규성을 충족하지 못하니 비모수검정인 윌콕슨을 하는건가요? 그리고 시험에서 μd값도 기본적으로 알려주는지도 궁금합니다.
해결됨
챗GPT와 파이썬으로 주식 자동매매 앱 및 웹 투자 리포트 만들기
numpy 1.23.4 pandas 2.0.3 버전으로 설치 했음에도 불구하고 아래와 같이 pip install pykrx를 하게되더라도 오류가 납니다.
미해결
한 입 크기로 잘라먹는 Next.js
강의 파트 : 2.16)SSG 4.폴백옵션 설정하기. 질문 : SSG경로 생성은 /books/[id] 페이지 요청이 발생했을 경우 생성되어야 하는걸로 이해했지만, index page만 접속해도 index page에 노출되는 id 값을 가진 데이터들이 전부 /books/[id] 에 해당하는 SSG 파일이 생성되었습니다. (지금 추천하는 도서, 등록된 모든 도서) (위의 사진은 빌드 후, 인덱스 페이지 요청 시 생성된 SSG파일들 입니다.) (인덱스에서 스크롤 해보니 생성되는것을 확인했습니다.) 이 상황은 next의 LInk컴포넌트 frefetch와 연관있는 경우일까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요, 시나공 책을 보니 object 컬럼의 nunique 값이 다를 때는 train, test 데이터를 concat한 뒤 원핫 인코딩을 해주어야한다고 나와있는데 레이블 인코딩도 마찬가지인가요? 모의문제 2에서는 neighbourhood의 nunique값이 다른데 concat 없이 레이블 인코딩을 진행하신 것 같아서 질문 남깁니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 # 원산지와 메뉴 기준 (평균, 합계) df.groupby(['원산지','메뉴']).agg(['mean','sum']) # 원산지와 메뉴 기준 (평균, 합계) df.groupby(['메뉴']).agg(['mean','sum'], numeric_only=True) 원산지와 메뉴기준으로 agg하여 mean 과 sum을 구했을때 코드를 알려주셨는데요, 원산지 하나의 칼럼의 mean과 sum을 보고싶을 때는 어떻게 해야하나요? 에러가 나네요,, 아마 원산지가 빠져서 문자열이라 그런거같은데, numeric_only = True을 어디에 넣어야하나요?
미해결
비전공자도 이해할 수 있는 Redis 입문/실전 (조회 성능 최적화편)
똑같이 해서 돌렸는데 데이터가 안보여서 로그 찍어 봤어요 컨트롤러에서 page 파라미터는 불러오는데 size 값만 안불러와요
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
선생님과 모든 코드와 튜닝을 똑같이 하고 가장 최종적으로 y_test로 채점해보았는데 저는 0.79대로 나오네요 ㅜ 실제 이런 점수로 나오면 시험점수에 많은 영향을 끼칠 수준인가여
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
선생님과 모든 코드를 똑같이 작성하고 똑같은 데이터로 하는데 왜 저는 평가값이 모두 다를까요
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
검증데이터 분리 코드 바로 전에 output을 드랍해서 train데이터에 다시 저장하셨는데 다시 또 분리할때 output컬럼을 드랍해야하는 이유가 무엇일까요
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=0) rf.fit(X_tr, y_tr) pred = rf.predict_proba(X_val) 촉박하게 공부하다 보니 평가지표에 대한 이해가 잘 되지 않는데요, 제출하는데는 크게 문제가 없는 것으로 보이는데 평가지표도 코드에 포함되어야 채점에 큰 문제가 없을..까요..?ㅠㅠ
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
age 컬럼에서 소수점인 칼럼을 찾기 위해 df[age] != round (df[age], 0)으로 수식 작성하셨는데요. 이렇게 될 경우, 36.3은 버림이 되면서 round 적용하기 전과, 적용한 이후가 같아져서 누락이 되는거 아닌지 궁금합니다. 영상에서는 36.3 값도 필터링이 되던데 어째서 가능한지 너무 궁금합니다ㅠ 바쁘신데 감사합니다!
해결됨
38군데 합격 비법, 2026 코딩테스트 필수 알고리즘
1. 현재 학습 진도 몇 챕터/몇 강을 수강 중이신가요? 1-5 어떤 알고리즘을 학습하고 계신가요? 알고리즘과 친해지기(2) 여기까지 이해하신 내용은 무엇인가요? max값을 구할 때 리스트의 max 함수를 사용할 수도 있는데 굳이 max 값을 따로 구하는 이유가 있으신가요? 그게 더 시간 복잡도상으로 좋아서인지 초심자 입장에서 생각해보려고 하는 건지 궁금합니다..
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
기출6회 제3유형 해설을보면 아래 ob / ex을 어디서 구하는건가요? ob는 어떻게 구하면 될 것같은데 ex는 제가 알아서 임의로 작성하면 되는건지 문의드립니다. ob = df['항암약'].value_counts().sort_index().to_list() ex = [0.1 * 20, 0.05 * 20, 0.15 * 20, 0.7 * 20] from scipy import stats stats.chisquare(ob, ex)