32. 캐글(kaggle) 필사 전략 수업 노트
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
32. 캐글(kaggle) 필사 전략 강의에서 노션 정리하신 것을 수업 노트에 올려 주신다고 하셨는데, 확인이 안되어 문의드립니다! (18:10)
- python
- 머신러닝
- 빅데이터
- pandas
- 빅데이터분석기사
172만명의 커뮤니티!! 함께 토론해봐요.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
32. 캐글(kaggle) 필사 전략 강의에서 노션 정리하신 것을 수업 노트에 올려 주신다고 하셨는데, 확인이 안되어 문의드립니다! (18:10)
해결됨
비전공자도 이해할 수 있는 AWS 중급/실전 (보안, 가용성편)
완강했습니다!! 처음 올린 질문이 해결이 되어서 질문을 수정했습니다! 위 사진은 제가 만드려고 하는 아키텍쳐입니다 사진에는 빠졌지만 alb도 있고 프론트서버에 연결되어있습니다 현재까지는 프론트서버만 만든상태입니다. 퍼블릭 서브넷에서 인터넷 게이트웨이 설치하고 접속이 되는건 확인했습니다. alb는 80,443 허용하였고 프론트는 22,80,443,3000허용하였습니다. (22는 나중에 배스천호스트로 옮길 생각입니다) 대상그룹은 프론트 ec2로 설정하였고 http 3000으로 설정해서 healty 연결된걸 확인하였습니다. 1. 로드밸런서의 dns로 들어가면 접속이 됩니다 2. ec2내에서 로컬호스트로 들어가면 접속이 됩니다 3. 도메인이나 ip를 검색하면 접속이 안됩니다 4. 로컬에서 nslookup하면 제 서버 ip를 찾지 못합니다. 어떤부분에서 빠뜨린게 있을까요? 이것저것 찾아보고 고민해도 해결이안되어서 4시간동안 찾다가 질문 드려봅니다 ㅠㅠ 조금 걸리는 점은 제가 도메인사고 인증서받고나서 모든 ec2와 보안그룹들을 다 지워서 비용이 안 나가게한 적이 있습니다. 그 이후에 다시 vpc, ec2 등등 만들고 기존 도메인과 인증서를 연결했는데 인증서를 새로 발급받지 않고 기존 것을 쓴 것이 혹시 문제되지 않았을까? 라는 것이 약간 걸립니다 그런데 도메인뿐만아니라 ec2의 ip로도 접근이 안되기 때문에 관련이 없다고 생각하여 그 부분은 건들지는 않았습니다 ㅠ
미해결
Airflow 마스터 클래스
안녕하세요, 최근에 airflow를 공부해보려고 해당 인강을 구매했는데, airflow3버전 인강 업데이트 예정이라는 공지를 보고, 대기 중에 있습니다. 혹시 언제쯤 업데이트 될 예정인지 알 수 있을까요? 아니면 우선 airflow2 버전으로라도 보는게 나을까요?
미해결
비전공자도 이해할 수 있는 CI/CD 입문·실전
Run ./gradlew clean build 2 ./gradlew clean build 3 shell: /usr/bin/bash -e {0} 4 env: 5 JAVA_HOME: /opt/hostedtoolcache/Java_Temurin-Hotspot_jdk/21.0.7-6/x64 6 JAVA_HOME_21_X64: /opt/hostedtoolcache/Java_Temurin-Hotspot_jdk/21.0.7-6/x64 7 /home/runner/work/_temp/ 24e2a6f8-136d-471b-b2ea-6203042af791.sh : line 1: ./gradlew: Permission denied Error: Process completed with exit code 126. 찾아보니깐 실행 권한이 없어서 ./gradlew 스크립트를 실행하지 못했다는 뜻이라고 하는데 즉, Gradle Wrapper 파일에 실행 권한이 없어서 생긴 문제가 맞을까요? - name: gradlew 실행 권한 부여 run: chmod +x ./gradlew 이렇게 붙여줬더니 되긴 하더라고요. 맞는 방법이 몰라서 여쭤봅니다.
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
첫 번째, 두 번째 둘 다 groupby(컬럼명)했는데 왜 첫번째는 에러가 나고 두번째는 정사적으로 작동하나요??
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
인덱스 값이 2001인 데이터(행)을 선택할 때 df.loc[2001] df.loc[2001].mean() loc 대신 df.iloc[1,:].mean() 위처럼 iloc 함수를 사용해도 되나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세 위와 같이 실행했는데 baseline roc_auc가 높게 나옵니다 그리고 y_test 실행결과 label과 점수가 비슷합니다. 어떤 이유일때문일까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
선생님 9회 기출유형 원본파일은 깃허브상에 없던데 업데이트 예정인가요?
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
강의를 보면서 강사님과 똑같이 진행을 하는데 값이 다릅니다. 그리고 영상에서는 max_depth를 설정했을 때가 설정하지 않았을 때 보다 값이 더 올라갔는데 저 같은 경우는 설정한 후 값이 더 내려갔습니다. 정상적인 건가요? #rf from sklearn.ensemble import RandomForestClassifier from sklearn.metrics import roc_auc_score, f1_score, accuracy_score rf = RandomForestClassifier(random_state=2025,max_depth=3) rf.fit(X_tr,y_tr) pred = rf.predict(X_val) pred_proba = rf.predict_proba(X_val) print(roc_auc_score(y_val,pred_proba[:,1])) print(f1_score(y_val,pred)) print(accuracy_score(y_val,pred)) # 0.9227272727272727 # 0.8571428571428571 # 0.8378378378378378 # max_depth = 3 # 0.9242424242424243 # 0.8 # 0.7837837837837838
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
roc_auc_score, f1_score, accuracy_score를 구할때 print문의 y_val,pred를 넣는데 왜 저 2가지를 넣는건가요? 그리고 proba는 뭔가요? print(roc_auc_score(y_val,pred_proba[:,1])) print(f1_score(y_val,pred)) print(accuracy_score(y_val,pred))
미해결
쿠버네티스 어나더 클래스-Sprint3 (#실무핵심 #Docker #Nginx #Minio #Longhorn)
15분 정도 강의내용중에 " StatefulSet 경우는 스토리지 클래스가 먼저 만들어져 있는 상태에서 StatefulSets에 이 VolumeClaimTemplage 이라는 속성에 storageClass이름을 넣으면 이렇게 각각의 파드들이 생길때마다 PVC와 PV가 만들어지고 볼륨이 만들어지고 이 구성들이 복잡해지는데 VolumeClaimTemplage사용하면 이렇게 storageclass가 있으면 statefulSet에서 사용만하면되서 구성방법은 더 쉬워졌다." 이말씀이 있습니다. 같은 말인거 같은데요...전자 후자 모두 VolumeClaimTemplage 사용하는데 앞 내용에서는 복잡하고 뒤에서는 쉬워졌다고 말씀하시니 헷갈립니다.똑같이 VolumeClaimTemplage 사용하는 내용같은데 말이죠~
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
<모델&평가>에서 fit(학습)을 시킬때는 왜 X_tr,y_tr을 넣고 예측을 할때는 왜 X_val를 넣나요 ? 그냥 아무거나 넣어도 되나요 ? #rf from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=2025) rf.fit(X_tr,y_tr) pred = rf.predict(X_val)
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
교재도 같이보고있는데요 교재 p.164쪽 'type1_data1.csv'파일은어디에 있나요? (교재 작업형 1 연습문제 파일 어디서 다운받나요?)
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
<데이터 전처리 &피처엔지니어링>에서 왜 id를 drop 하나요? 그리고 <검증 데이터 분리>에서 는 왜 output을 drop 하나요? train = train.drop('id',axis=1) test_id = test.pop('id') test.head() from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train.drop('output',axis=1),train['output'],test_size=0.15, random_state=2025)
미해결
[개정판] 파이썬 머신러닝 완벽 가이드
알파값을 릿지는 0.05,0.1,1,5,8,10,12,15,20 라소는 0.001,0.005------ 이렇게 잡는 이유와 기준이 무엇인지? 그냥 경험치인건지
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
# your code import pandas as pd df = pd.read_csv("members.csv") df.head() #views 컬럼에 결측치가 있는 데이터(행)을 삭제하고 df.isnull().sum() #views에 결측치 4개 # print(df.shape) df = df.dropna(subset = ['views']) # print(df.shape) #f3 컬럼의 결측치는 0, silver는 1, gold는 2, vip는 3 으로 변환한 후 총 합을 정수형으로 출력하시오 df['f3'] = df['f3'].fillna(0) df['f3'] = df['f3'].replace('silver', 1) df['f3'] = df['f3'].replace('gold', 2) df['f3'] = df['f3'].replace('vip', 3) # print(df.head(20)) print(int(df['f3'].sum())) numpy 안 쓰고 이렇게 작성해도 되나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
3사분위수 - 1사분위 수 값을 구할 때 선생님 처럼 r2, r1 변수 안 만들고 df = df[:int(len(df) * 0.7)] #70% 데이터 선택 IOQ = df['views'].quantile(.75) - df['views'].quantile(.25) print(IOQ) 이렇게 구해도 되나요?
해결됨
비전공자도 이해할 수 있는 CI/CD 입문·실전
The overall deployment failed because too many individual instances failed deployment, too few healthy instances are available for deployment, or some instances in your deployment group are experiencing problems. CodeDeploy Agent는 EC2에서 active 상태이고, S3에 업로드도 잘 되었으며, IAM 역할도 다음과 같이 설정했습니다: - EC2 인스턴스 역할: code-deploy-ec2-role (정책: code-deploy-ec2-policy 세부 S3 ) - CodeDeploy 서비스 역할: AWSCodeDeployRole 포함 하지만 배포 시 아래와 같은 에러가 납니다: > The overall deployment failed because too many individual instances failed deployment, or too few healthy instances... 추가로 EC2 내에서 /var/log/aws/codedeploy-agent/ 로그 폴더가 존재하지 않습니다. appspec.yml 및 start.sh 도 정상 포함했고, S3에 .tar.gz 도 업로드 확인했습니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
제가 푼 내용을 보면 pred = rf.predict(test) : 질문자 pred = rf.predict(x_val) : 해설 위 두가지가 다릅니다. 해당 건 때문에 pred 했을 때, 값 차이가 많이 나는건가요? ㅜ_ㅠ 챗gpt에 물어보니 어떨때는 test고 어떨대는 x_val인지 아직도 모르겠습니다. # 라이브러리 및 데이터 불러오기 import pandas as pd train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_test.csv") # train.info() # test.info() target = train.pop('TotalCharges') train = pd.get_dummies(train) test = pd.get_dummies(test) train, test = train.align(test, join='left', axis=1) from sklearn.model_selection import train_test_split x_tr, x_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state=0) rf.fit(x_tr, y_tr) pred = rf.predict(test) submit = pd.DataFrame({'pred' : pred}) submit.to_csv('result.csv', index=False) ans = pd.read_csv('result.csv') print(ans)
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
'age' 컬럼의 이상치(소수점 나이와 음수나이, 0포함)를 제거하고 제거 전 후의 views 컬럼 표준편차를 더하시오 (최종 결과 값은 소수 둘째자리까지 출력, 셋째자리에서 반올림) 제가 생각한 이상치 제거는 1. 사분위수를 이용해서 1차적으로 이상치를 제거하고 1번을 통해 필터링 된 데이터에서 0, 음수, 소수 데이터를 제거 라고 생각했는데 아닌가요? 답은 우연인지 의도인지 둘다 8420.69 이 나오긴 했습니다 import pandas as pd df = pd.read _csv( " https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv " ) bef = df[ 'views' ].std() #1 #0, 음수 제거 -> 소수 제거 # opt6_1 = df['age'] <= 0 # df= df[~opt6_1] # opt6_2 = df['age'] % 1 == 0 # df = df[opt6_2] # aft = df['views'].std() # print(round(bef+aft, 2)) ###### 8420.69 출력 #2 # 이상치 제거 -> 0,음수 제거 -> 소수제거 Q1 = df[ 'age' ].quantile( 0.25 ) Q3 = df[ 'age' ].quantile( 0.75 ) IQR = Q3 - Q1 cond1 = df[ 'age' ] > Q3 + ( 1.5 * IQR) df = df[~cond1] cond2 = df[ 'age' ] < Q1 - ( 1.5 * IQR) df = df[~cond2] cond3 = df[ 'age' ] <= 0 df = df[~cond3] cond4 = df[ 'age' ] % 1 == 0 df = df[cond4] aft = df[ 'views' ].std() print ( round (aft + bef, 2 )) ###### 8420.69 출력