안녕하세요! m1 맥북으로 실습을 하려고 합니다. 커뮤니티에 전부 window 관련 질문들만 있어 질문드려요 ! 맥북 사용시에 권장하는 환경 설정 방법을 알려주실수 있을까요? 다른분 질문에 답변으로 docker는 권장하지 않는다고 하셔서 UTM으로 우분투를 설치해보려고 했는데 에러가 계속 발생해서 어려움에 겪고 있습니다 ㅜ (virtual box 는 m1 맥에서 지원이 안되는 상황이구요..)
3-61~63 추론-문제8 문제8번에서 그룹1과 그룹2의 평균이 각각 0.75, 2.33이라는 것이 아닌가요? 만약 그러하다면, 위 내용에 대한 것은 고려하지 않고 바로 두 집단의 평균이 동일하다는 귀무가설을 채택할 수 있다고 볼 수 있는 것인지, 왜 그러한지 궁금합니다 제가 위 이미지의 내용을 받아들인 방법이 잘못된 것이라면, 위 이미지의 내용을 어떻게 해석해야하는지 궁금합니다.
안녕하세요 수강생입니다. 강의듣다가 질문이 있어 이렇게 글남깁니다. 섹션4 - 모의고사1 - 3번 문제의 replace를 활용하거나 map을 활용하는 부분입니다. 저는 .replace.replace.replace를 반복하지 않고 아래와 같이 곧바로 딕셔너리 형태로 코드를 치니 마치 map에 딕셔너리를 리스트로 담은 것처럼 동작을 하던데 올바른 방법인지 모르겠습니다. 막상 답이 133으로 동일하게 나오다보니 replace나 map의 차이점 또는 딕셔너리의 올바른 활용(?) 부분 이 궁금해지네요. import pandas as pd df = pd.read_csv('members.csv') df = df.dropna(subset=['views']) # print(df.isnull().sum()) df['f3'] = df['f3'].fillna(0) df['f3'] = df['f3'].replace({'silver':1, 'gold':2, 'vip':3}) # print(df.head()) print(int(df['f3'].sum()))
Standalone 환경을 처음 세팅하게 되면 dags 디렉토리가 별도로 없는데 사용자가 직접 만들어주면 되는지 질문드립니다. 그리고 standalone 으로 airflow 서버를 작동시킨 이후 다시 exit 할 경우 자꾸 localhost 에 서버가 남아있어 재 실행이 안되서 컴퓨터 리붓을 해야하는데 혹시 다른 방법이 있을까요? 아래와 같은 방식으로 PID 서버를 kill 하지만 그래도 안될 경우가 많은 것 같습니다. (수정) 아래 방법은 작동하는 것 같네요 ps -ef | grep airflow sudo kill -9 [PID port]
안녕하세요~ 지난 6회 실기 떨어지고.. ㅜㅜ 이번에 7회 재도전하는 수험생입니다~ 여러 유튜브 강의를 들어보았으나 퇴근후딴짓님 강의가 제일 저랑 잘맞는것 같아서 인프런에서 수강하고 있습니다. 강의를 계속 듣다 보니 추가적으로 업데이트 되는 강의도 많고 섹션 17(3유형)은 곧 삭제 예정이라고 하는데 섹션17은 꼭 볼 필요는 없는건가요? 아직 초반 듣고 있어서요.. 다음은 공부 방향에 대한 질문입니다.. 지난 6회는 3유형이 신설되었고 비전공자 직장인이라 충분한 연습을 못하고 갔습니다. 1유형은 하필 datetime 변환 문제가 시험장에서 기억이 안나서 2문제 날려버렸고.. 2유형은 베이스라인 외워서 전처리부터 모델링까지 다했음에도 10점 나오더군요.. ㅠㅠ 3유형은 유튜브에 여러 무료 강의와 데이터진흥원의 샘플 문제를 여러 차례 연습했음에도 달랑 1문제 맞은 것 같아요.. 많은 좌절감을 느끼며 이번에는 최대한 잘 준비해서 꼭 합격하고 싶습니다. 이번 퇴근후딴짓 커리큘럼만 잘 이해하고 숙지하면 충분할까요? 긍정의 에너지와 격려 말씀부탁드립니다~
데이터 전처리시 범주형(object)이면 라벨 or 원핫 인코딩 수치형(int or float) 이면 민맥스스켈러 or z스켈러 인데 타겟값이 범주형인가 수치형인가에 따라 전처리 방법을 다르게 하는건가요 아니면 타겟값과 상관 없이 문자형, 수치형 둘다 해보는건지 또는 문자형 or 수치형 중에 아무거나 해도 상관없는건지 궁금합니다! 또 어떠한 경우에 라벨, 원핫, 민맥스스켈러, z스켈러를 사용하는지도 궁금합니다! ex) 작업형2번 모의문제 1번에서는 타겟 값이 수치형 이지만 전처리시 민맥스스켈러 혹은 z스켈러를 이용하지 않고 문자형컬럼을 제거하거나 라벨, 원한 인코딩을 한 이유가 있을까요? 타겟값이 범주형이기 때문에 그런건가요..ㅠㅠ 파이썬이 처음이라 개념이 잘 안잡혀 있어서 헷갈리네요 ㅜㅜ
df.to _csv('data2.csv', index=False)를 할 때 인덱스를 제외하고 저장을 한다면, to_csv 후 이를 다시 read_csv를 해서 불러왔을 때 데이터프레임 내의 record들의 순서는 바뀌지 않고 고정인가요? SQL을 사용할 때는 Select를 할 때 record의 순서는 계속 바뀌던데 판다스에서는 특별히 조작을 하지 않는 이상 record들의 순서는 바뀌지 않는 것으로 이해하면 될까요?
강의에서는 강사님께서 airflow standalone 을 사용하셨는데, docker image로 airflow 서버 생성한 다음 postgres 서버와 연결하려고 하니 테스트 fail이 나고 DAG도 돌아가지 않는 것 같습니다. 혹시 docker image 상에서 DB connect 하는 방법 가이드 부탁가능하실까요? Airflow - connection setting DB connection info
java 버전을 확인해보니 1.7 이더라고요 그래서 1.8 버전을 설치 하려고 yum unstall oracle-j2sdk1.8 했는데 다음과 같은 에러가 납니다. [root@server01 yum.repos.d]# yum install oracle-j2sdk1.8 Loaded plugins: fastestmirror, refresh-packagekit, security Setting up Install Process Determining fastest mirrors YumRepo Error: All mirror URLs are not using ftp, http[s] or file. Eg. Invalid release/repo/arch combination/ removing mirrorlist with no valid mirrors: /var/cache/yum/x86_64/6/base/mirrorlist.txt Error: Cannot find a valid baseurl for repo: base 그런데 실습은 하지 말라고 했는데 1.8 버전 설치 안해도 되는건가요??
안녕하세요 강사님 먼저 좋은 강의 만들어주셔서 감사드립니다. 빅데이터 관련 영역을 조금씩 배워나가고 싶어 강의를 신청하게 됐습니다. 다름이 아니라 혹시 강의 영상 혹은 수업 관련 자료중 필요한 부분을 캡처해서 제 개인 티스토리 블로그에 올려도 되는지 여쭙고자 글을 작성했습니다. 다른 분들과 공유보다는 스스로 복습하는 용도로 글을 작성하는 목적이 크지만 인터넷에 올라오는 내용인 만큼 먼저 허락을 구하고자 합니다. 상업적인 목적은 없으며 블로그 광고 연동도 신청하지 않을 것입니다. 만약 혹시라도 하게 된다면 다시 한 번 말씀드리겠습니다. 만약 캡처 사진을 올리는게 불가하시다면 비공개 처리하여 공유 및 열람이 안 되도록 조치한 후 저 혼자만 글을 읽을 수 있도록 하겠습니다. 감사합니다.