머신러닝 2강 데이터 불러오기
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 데이터 불러오면 name 'pd' is not defined 라고 에러메세지가 뜨는데 뭐가 문제인가요?
- python
- 머신러닝
- 빅데이터
- pandas
- 빅데이터분석기사
172만명의 커뮤니티!! 함께 토론해봐요.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 데이터 불러오면 name 'pd' is not defined 라고 에러메세지가 뜨는데 뭐가 문제인가요?
해결됨
커뮤니티에서 바로 써먹는 슬랙 봇 만들기
안녕하세요 강사님! 강의 너무 유익하게 보고 있습니다. 혹시 강의에서 띄우시는 포스트잇은 맥 내장 스티커는 아닌 거 같은데 무슨 앱일까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
첫번째 시도 두번째 시도 딱 rf.fit(X_tr, y_tr) 이 부분에서 에러메시지가 뜨는데 두 가지 시도 전부 다 해도 문제네요. 도저히 에러를 고칠 수 없어서 문의드려요.
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요 선생님 질문이 있어서 글남겨요 혹시 실기 시험에서 1유형 풀이시 sql라이브러리를 사용해서 풀어도 되나요? 제가 sql이 매우 익숙한 사람이여서요
미해결
실습으로 손에 잡히는 SQLD(2과목)
답이 2번인 것은 이해가 되는데 3, 4번 문항에서 질문이 있습니다. 배우기로는 GROUPING SETS를 GROUP BY와 UNION ALL로 바꿀 때 SELECT 컬럼명 중 GROUP BY 를 하지 않는 값을 NULL로 써서 했는데 이것을 MAX(Y.col1), MAX(X.keyb) 로 해도 되는건가요?
미해결
실습으로 손에 잡히는 SQLD(2과목)
78번 문제 질문드립니다. 2번 문항의 SELECT 구문에서 CASE GROUPING(B.지역ID)~ 로 되어있는데 B.지역명이여야 맞는거 아닌가요? ㅠㅠ 그리고 ELSE 뒤에 MIN(지역명)도 가능한건지 이해가 잘 안됩니다. 지역명은 서울, 경기 이런 내용인데 MIN 으로 출력이 되는게 의아합니다..
해결됨
[신규 개정판] 이것이 진짜 크롤링이다 - 실전편 (인공지능 수익화)
r
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
그냥 object라고 쓸 때가 있고 ""붙이는 경우도 있는데, 이 차이가 궁금합니다
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요. 강의와 교재로 학습중입니다. 코랩 환경에서 자꾸 문서 팝업이 떠서 불편하여 구글링을 해보았는데도 잘 안나와서 혹시 방법을 아실까 하여 질문드립니다. 사진과 같이 ( 를 칠때 이와 관련된 안내문서 창이 나타나는데, 이걸 안나타나게 하는 방법이 있을까요? 답변에 미리 감사드립니다.
해결됨
파이썬/장고 웹서비스 개발 완벽 가이드 with 리액트 (장고 4.2 기준)
안녕하세요 강사님, 강사님 강의는 다른 강사님들 강의와는 다르게 먼저 한번 전체적으로 다뤄주고나서 나중에 세세히 강의해주시는것 같습니다. 지금 장고핵심기능 리뷰를 보고 있는데, 각 섹션마다 수강생들이 어떤 부분을 염두하고 보면 좋은지를 알려주시면, 혹은 어떤 목적으로 섹션을 나눴는지를 알려주시면 제가 강의를 이해하고 앞으로 강의를 듣는데 좀더 이해가 잘 될거같습니다. 감사합니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
선생님 해설에 보면 f3컬럼의 결측치를 replace로 활용하여 0으로 바꿀때 import numpy as np df['f3'] = df['f3'].replace(np.nan,0) 라고 되어있는데 제가 캡쳐한 화면처럼 풀어도 상관이 없는걸까요?
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
강의 15:40 정도 보면 # 남성 중 0과 1 (인원수) 부분에서 코드를 똑같이 입력했는데 저는 뒤에 값이 0이 나옵니다... 뭐가 잘못된건가요,,? 는
해결됨
초보자를 위한 BigQuery(SQL) 입문
3. 각 트레이너별로 그들이 포켓몬을 포획한 첫 날(catch_date)을 찾고, 그 날짜를 'DD/MM/YYYY' 형식으로 출력해주세요. 해당 문제에서 catch_date는 UTC 기준의 데이터이므로, 한국 기준으로 하려면 catch_datetime을 사용해야 한다고 하셨는데요! 테이블을 보면, TIMESTAMP 타입인 catch_datetime만 UTC 기준의 데이터인 것으로 이해했는데 DATE 타입인 catch_date가 UTC 기준의 데이터인 이유가 무엇인가요?
미해결
[신규 개정판] 이것이 진짜 크롤링이다 - 실전편 (인공지능 수익화)
1 . 해당 명령어를 치려면 전역변수로 등록 하고 ui 파일 있는 위치에서 명령어를 실행하기 2 . 환경변수 등록 없이 pyside6-uic.exe 파일이있는 폴더로 터미널 경로를 이동하고 .ui 파일도 exe 폴더있는 경로로 이동시켜서 명령어 실행 위에 두가지 방법으로 했을때 .py로 컴파일이 됐었는데 pyside6-uic login.ui -o login_ ui.py 명령어 실행 할때 vscode 로 다른 방법이 있나요? 환경변수 등록을 안하고 그냥 터미널로 바로 실행하면 pyside6-uic 배치파일 에러가 떴었고 .ui 파일 있는곳에서 실행을 꼭 해야 하더라고요
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
원핫 인코딩을 했는데 0,1 이 아닌 true false 가 나오는 이유가 궁금합니다.
미해결
실습으로 손에 잡히는 SQLD(2과목)
아직 github에서 못찾겠는데 안올려주신건가요? ㅠㅠ
미해결
BigQuery(SQL) 활용편(퍼널 분석, 리텐션 분석)
--1. 사용자별 쿼리를 실행한 총 횟수를 구하는 쿼리를 작성해주세요. 단, group by를 사용해서 집곟나ㅡㄴ 것이 아닌 query_logs의 데이터의 우측에 새로운 컬럼을 만들어주세요. select *, count(query_date) over(partition by user) as total_query_cnt from advanced.query_logs order by 1, 3 --2. 주차별로 팀 내에서 쿼리를 많이 실행한 수를 구한 후, 실행한 수를 활용해 랭킹을 구해주세요. 단, 랭킹이 1등인 사람만 결과가 보이게 해주세요 with query_cnt_by_team as( select extract(WEEK from query_date) as week_number, team, user, count(user) as query_cnt from advanced.query_logs group by all ) select *, rank() over(partition by week_number, team order by query_cnt desc ) as rk from query_cnt_by_team qualify rk = 1 order by 1, 2, 4 desc -- 3. (2번 문제에서 사용한 주차별 쿼리 사용) 쿼리를 실행한 시점 기준 1주 전에 쿼리 실행 수를 별도의 컬럼으로 확인할 수 있는 쿼리를 작성해주세요. with query_cnt_by_team as( select extract(WEEK from query_date) as week_number, team, user, count(user) as query_cnt from advanced.query_logs group by all ) select *, lag(query_cnt, 1) over(partition by user order by week_number) as prev_week_query_cnt from query_cnt_by_team -- 4. 시간의 흐름에 따라 일자별로 유저가 실행한 누적 쿼리 수를 작성해주세요. select *, sum(query_cnt) over (partition by user order by query_date rows between unbounded preceding and current row) as cumulative_sum from ( select query_date, user, count(user) as query_cnt from advanced.query_logs group by all ) order by 2, 1 -- 5. 다음 데이터는 주문 횟수를 나타낸 데이터입니다. 만약 주문 횟수가 없다면 NULL로 기록됩니다. 이런 데이터에서 NULL 값이라고 되어있는 부분을 바로 이전 날짜의 값으로 채워주는 쿼리를 작성해주세요. WITH raw_data AS ( SELECT DATE '2024-05-01' AS date, 15 AS number_of_orders UNION ALL SELECT DATE '2024-05-02', 13 UNION ALL SELECT DATE '2024-05-03', NULL UNION ALL SELECT DATE '2024-05-04', 16 UNION ALL SELECT DATE '2024-05-05', NULL UNION ALL SELECT DATE '2024-05-06', 18 UNION ALL SELECT DATE '2024-05-07', 20 UNION ALL SELECT DATE '2024-05-08', NULL UNION ALL SELECT DATE '2024-05-09', 13 UNION ALL SELECT DATE '2024-05-10', 14 UNION ALL SELECT DATE '2024-05-11', NULL UNION ALL SELECT DATE '2024-05-12', NULL ), raw_data2 as( select *, last_value(raw_data.number_of_orders ignore nulls) over(order by date) as last_value_orders from raw_data ) select * from raw_data2 WITH raw_data AS ( SELECT DATE '2024-05-01' AS date, 15 AS number_of_orders UNION ALL SELECT DATE '2024-05-02', 13 UNION ALL SELECT DATE '2024-05-03', NULL UNION ALL SELECT DATE '2024-05-04', 16 UNION ALL SELECT DATE '2024-05-05', NULL UNION ALL SELECT DATE '2024-05-06', 18 UNION ALL SELECT DATE '2024-05-07', 20 UNION ALL SELECT DATE '2024-05-08', NULL UNION ALL SELECT DATE '2024-05-09', 13 UNION ALL SELECT DATE '2024-05-10', 14 UNION ALL SELECT DATE '2024-05-11', NULL UNION ALL SELECT DATE '2024-05-12', NULL ), raw_data2 as( select *, last_value(raw_data.number_of_orders ignore nulls) over(order by date) as last_value_orders from raw_data ) --6. 5번 문제에서 NULL을 채운 후, 2일 전 ~ 현재 데이터의 평균을 구하는 쿼리를 작성해주세요(이동평균) select * except(number_of_orders), avg(last_value_orders) over (order by date rows between 2 preceding and current row) as moving_avg from raw_data2 --7. app_logs 테이블에서 Custom session을 만들어 주세요. 이전 이벤트 로그와 20초가 지나면 새로운 session을 만들어 주세요. session은 숫자로 (1, 2, 3..) 표시해도 됩니다. -- 2022-08-18의 user_pseudo_id(1997494153.8491999091)은 session_id가 4까지 나옵니다 with base as( select event_date, datetime(timestamp_micros(event_timestamp), 'Asia/Seoul') as event_datetime, event_name, user_id, user_pseudo_id from advanced.app_logs where event_date = "2022-08-18" and user_pseudo_id = "1997494153.8491999091" order by event_timestamp ), diff_data as ( select *, datetime_diff(event_datetime, prev_event_datetime, second) as second_diff from ( select *, lag(event_datetime, 1) over(partition by user_pseudo_id order by event_datetime) as prev_event_datetime from base order by event_datetime ) ) select *, sum(session_start) over(partition by user_pseudo_id order by event_datetime) as session_number from ( select *, case when prev_event_datetime is null then 1 when second_diff >= 20 then 1 else null end as session_start from diff_data )
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
X_train['age']가 아니라 X_train[X_train['age'] 인 이유가 궁금합니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
이 둘의 차이는 뭘까요?
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
수치형 컬럼들 리스트로 만들 시, cols = list(X_train.columns[X_train.dtypes != 'object']) 시험에서 이렇게 해도 되나요? object랑 int랑 float 세개만 나오면 이렇게 해도 될 듯한데, 그 외 변수들이 나올 경우 대비해서, 수치형 컬럼들만 리스트 할 때, 어떤식으로 코딩하는 것이 나을까요?