작업형 2 질문
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형2를 할때 원-핫 인코딩이나 레이블인토딩을 진행해서 더 성능이 좋은 모델을 쓰고 있는데 강의에서 불균형일때 원-핫인코딩처럼 합쳣다가 푸는 방식으로 추천해주셨는데 레이블도 합쳤다가 푸는형식으로 해도 상관이 없는지? 와 안전하게 그냥 둘다 합쳐서 인코딩하는 방식으로 해도 상관없는지 궁금합니다!
- python
- 머신러닝
- 빅데이터
- pandas
- 빅데이터분석기사
172만명의 커뮤니티!! 함께 토론해봐요.
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형2를 할때 원-핫 인코딩이나 레이블인토딩을 진행해서 더 성능이 좋은 모델을 쓰고 있는데 강의에서 불균형일때 원-핫인코딩처럼 합쳣다가 푸는 방식으로 추천해주셨는데 레이블도 합쳤다가 푸는형식으로 해도 상관이 없는지? 와 안전하게 그냥 둘다 합쳐서 인코딩하는 방식으로 해도 상관없는지 궁금합니다!
해결됨
(AI 퀀트) 코드 한 줄 안 쓰고 주식 자동 분석 시스템 만들기 feat. Claude CLI
62강 노션 링크 사용권한 승인 부탁드립니다.
해결됨
(AI 퀀트) 코드 한 줄 안 쓰고 주식 자동 분석 시스템 만들기 feat. Claude CLI
안녕하세요 62강 노션 링크 사용권한 승인 부탁드립니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요 전체적으로 이런 식으로 작업형 2를 풀어왔는데, 시험 전 마지막으로 올바른 코드인지 점검 부탁 드리고 싶습니다. EDA -> target값 분리 -> 스케일링 -> 인코딩 -> 데이터 분리 -> 머신러닝 -> 평가 -> 테스트 예측 순서로 풀어왔는데, AI한테 질문하니 카테고리가 안맞아 train, test를 불가피하게 합쳐서 풀어야 할 땐, 인코딩을 먼저 하라는 말에 혼란스러워 질문 드립니다. import pandas as pd train = pd.read_csv("data/customer_train.csv") test = pd.read_csv("data/customer_test.csv") # 평가: RMSE (회귀) # target: 총구매액 (2482개의 행) # 결측값: 환불금액 # object 컬럼: 주구매상품, 주구매지점 (2개) / num 컬럼: 그외 (7+1개) pd.set_option('display.max_columns', None) print(train.shape, test.shape) # print(train.info()) # print(test.info()) # print(train.head()) # print(test.head()) # print(train.describe(include ='O')) # print(test.describe(include = 'O')) # 카테고리 확인 (주구매 불일치 -> 합쳐서 인코딩) o_cols = train.select_dtypes(include = 'O').columns # for col in o_cols: # if (set(train[col]) == set(test[col])): # print(col, '카테고리 일치') # else: # print(col, '카테고리 불일치') # 결측치 채우기 train['환불금액'] = train['환불금액'].fillna(0) test['환불금액'] = test['환불금액'].fillna(0) # print(train.isnull().sum().sum()) # print(test.isnull().sum().sum()) # id, target 분리 train_id = train.pop('회원ID') test_id = test.pop('회원ID') target = train.pop('총구매액') print(train.shape, test.shape) print(target.describe()) # 스케일링 n_cols = train.select_dtypes(exclude = 'O').columns # print(n_cols) # print(train.head()) from sklearn.preprocessing import MinMaxScaler scaler = MinMaxScaler() train[n_cols] = scaler.fit_transform(train[n_cols]) test[n_cols] = scaler.transform(test[n_cols]) # print(train.head()) # 인코딩 # 데이터 합치기 combined = pd.concat([train, test]) # 원핫 # combined = pd.get_dummies(combined) # train = combined[:len(train)] # test = combined[len(train):] # print(train.shape, test.shape) # 라벨인코더 from sklearn.preprocessing import LabelEncoder o_cols = train.select_dtypes(include = 'O').columns for col in o_cols: le = LabelEncoder() combined[col] = le.fit_transform(combined[col]) train = combined[:len(train)] test = combined[len(train):] print(train.shape, test.shape) # 데이터 분리 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size = 0.2, random_state = 0) print(X_tr.shape, X_val.shape, y_tr.shape, y_val.shape) # 머신러닝 # 랜포 # from sklearn.ensemble import RandomForestRegressor # rf = RandomForestRegressor(random_state = 0) # rf.fit(X_tr, y_tr) # pred = rf.predict(X_val) # lightgbm import lightgbm as lgb model = lgb.LGBMRegressor(random_state = 0, verbose = -1) model.fit(X_tr, y_tr) pred = model.predict(X_val) # 평가 from sklearn.metrics import root_mean_squared_error rmse = root_mean_squared_error(y_val, pred) print(rmse) # 813.2017203251257 (원핫, 랜포) # 808.845167469651 (라벨, 랜포) # 779.7626410741833 (라벨, lgb) - 채택 # 779.7626410741833 (원핫, lgb) # 테스트 예측 (전체 train으로 학습) model.fit(train, target) pred = model.predict(test) submit = pd.DataFrame({'pred': pred}) submit.to_csv('result.csv', index = False) print(pd.read_csv('result.csv').head()) print(pd.read_csv('result.csv').shape)
해결됨
베개투자법 완성: 아침이 설레는 AI 주식 완전 자동매매 Claude 바이브코딩
안녕하세요. 실습 2인데 커서 아이디라던지 git 설치의 안내는 다른강의에 있는 것들을 선행해야하는건가요?? 과정이없이 바로 실행하라고만해서 따라가질 못하고있어요 ;;
미해결
베개투자법 완성: 아침이 설레는 AI 주식 완전 자동매매 Claude 바이브코딩
강의 제목/ 베게 투자법완성: 아침이 설레는 AI완전 자동매매 CLAUDE 바이브코딩 터미널 이라고 말씀하셨는데 터미널은 무엇이며 어디에 가서 봐야 하는지 갑자기 전문용어로 넘어가서 깜짝 놀랬습니다 ㅠㅠ
미해결
프로그래밍 시작하기 : 파이썬 입문 (Inflearn Original)
25분 35초에서 화면에 아래에는 PROBLEMS OUTPUT DEBUG CONSOLE TERMINAL 등등의 메뉴바가 보이면서 Windows PowerShell 등이 보이는데 제 거에는 그런 게 없이 실행도 안 되는데요.
미해결
프로그래밍 시작하기 : 파이썬 입문 (Inflearn Original)
25분 35초에서 print('Hello python!') 하고 실행할 때는 Ctrl+F5키를 눌렀는데 메뉴바 옆에 검색창이 뜨는데 왜 그럴까요?
미해결
클로드 코드 완벽 마스터: AI 개발 워크플로우 기초부터 실전까지
생성된 파일과 제가 생성된 파일 및 디렉토리가 되는 이유가 뭐죠. 그리고 그리고 버전이 다른 이유는요? 그럼 package-lock.json파일의 내용만 수정하면 되는 건가요? 그리고 제가 실습한 모든 packeage에는 "^" 문자가 있는데 무슨 이유 인가요?
미해결
클로드 코드 완벽 마스터: AI 개발 워크플로우 기초부터 실전까지
[ 문제 ] vs code에서는 claude 연결해서 정상적으로 타로카드 만드는 거 까지 가능했는데, powershell에서는 path를 등록해도 claude -v 버전만 확인 가능하고, claude 실행이 안됨 directory가 local\bin에 없어서 "C:\Users\hyunjun94.park\.vscode\extensions\anthropic.claude-code-2.1.178-win32-x64\resources\native-binary"에 있는거를 확인하고 local\bin과 위에까지 path 저장했는데, claude라고 치고 실행하면 "+ claude + ~~~~~~ + CategoryInfo : NotSpecified: (:String) [], RemoteException + FullyQualifiedErrorId : NativeCommandError"라고 나옴 그럼 그냥 vscode에서 아래와 같이 제대로 나오는데 vs code에서 그냥 진행하면 될지 문의
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요 현재 작업형 2 문제 풀이 중 인코딩을 하는 경우 아래와 같이 코드를 작성하고 있습니다 import pandas as pd train= pd.read_csv('/content/churn_train.csv') test= pd.read_csv('/content/churn_test.csv') #(4116, 19) (1764, 18) target= train.pop('TotalCharges') #1. 인코딩 df= pd.concat([train, test]) df1= pd.get_dummies(df) train= df1.iloc[:len(train)].copy() test= df1.iloc[len(train):].copy() 인코딩 후 train, test로 나누는 과정에서 미리 train의 길이를 지정하고 그 변수를 넣는 것이 맞는 걸까요? 아니면 기존의 방식 (위) 처럼 해도 무관한지 궁금합니다 import pandas as pd train= pd.read_csv('/content/churn_train.csv') test= pd.read_csv('/content/churn_test.csv') #(4116, 19) (1764, 18) target= train.pop('TotalCharges') train_len= len(train) #1. 인코딩 df= pd.concat([train, test]) df1= pd.get_dummies(df) train= df1.iloc[:train_len].copy() test= df1.iloc[train_len:].copy()
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요. 원래는 작업형3을 아예 버리려고 했는데 남은 시간동안 작업형3을 조금이라도 공부하려고 하는데 어떻게 해야될지 모르겠어서 질문글 남깁니다. 우선 빅이시 영상에서 소개하는 summary 확인하는 방법은 숙지해두었는데, 그외에 직접 검정을 하거나, 기초통계에 대한 지식은 거의 없는 상황입니다. 현재 상황에서 어떤걸 하는게 가장 좋은 전략일까요? 기출에 나온 작업형 3 관련 개념들이라도 숙지하고 시험장 들어가는게 현재로선 최선일까요? 감사합니다.
미해결
Pytorch 를 활용한 딥러닝 Part 1 기본 알고리즘 A to Z 마스터
14강 최소제곱법을 이용한 다중선형회귀에서 강사님께서 언급하신 예시 데이터의 특징이, X^TX 가 Singular Matrix 이기 때문에 유사역행렬을 이용하여 해를 찾는다고 하셨는데요. 최소제곱법에 의한 풀이법을 좀 더 검색하고 알아보니, 강사님께서 설명하신 방법인 X, y 값을 평균값으로 중심이동해서 구하는 방법 말고, X 데이터 행렬의 맨 앞에 1로 채워진 열벡터 데이터를 삽입하고 W 벡터를 w1, w2, w3 이 아닌 w0=b, w1, w2, w3 으로 하여 중심이동 없이 바로 W와 b를 구하는 방법이 소개되어있었습니다. 그런데 14강의 예제를 통해 그렇게 풀어보니 W와 b의 결과가 전혀 다르게 나왔는데 (몇번을 검산해도 똑같습니다.) 이 이유가 궁금합니다. 다시 말해 X^TX 가 Singular Matrix 가 아니라면 역행렬이 명백히 존재하므로 어떻게 계산해도 같은 결과가 나오는것이고, X^TX 가 Singular Matrix 이기 때문에 행렬의 rank 가 적어 어떤 방법으로 유사 역행렬을 구하여 계산했느냐에 따라 다른 답이 나올 수도 있는것인지 궁금합니다. 이에 대한 답변을 부탁드립니다.
해결됨
한 입 크기로 잘라먹는 바이브코딩 - 기초부터 실전 배포까지 (클로드 & 코덱스)
클로드 코드로 자바 스크팁트 수정할 때.. 좌측 index.html에는 반영이 안되더라구요 강의에서는 반영이 되는데 ㅠㅠ 따로 스크립트 추가 확인이 안됩니다,, 버전관리, git에서 INIT커밋 하면 저는 이렇게 팝업창이 뜨면서 커밋이 안되는데 어떻게 해야할까요? 커밋이 안되어서 그런지 좌측 하단 그래프 쪽에 강의에서 뜨는 내역도 안뜹니다..
미해결
프로그래밍 시작하기 : 파이썬 입문 (Inflearn Original)
강의 8분 50초 에 영문계정인지 확인해 보라고 하셨는데요. 제 계정은 Microsoft 계정으로 되어 있는데 그럼 영문 계정에 해당 되는 건가요? 마이크로소프트 계정이 topikgo 이메일로 되어 있는데요. 계정명이 모두 영문이면 되는 건가요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
영상 13:40 지점에서 데이터의 크기가 작으면 train, validation 데이터를 분리 시키지 않고 train 데이터 전체로 모델 학습시키라고 알려주셨는데, train 데이터의 크기가 어느정도 될때 이 방법을 사용하면 좋은지 기준이 있나요?
해결됨
Claude Code Harness & Graph Engineering 클로드코드 심화 CLI 하네스 엔지니어링 실무
안녕하세요 8강의 디버깅 하네스는 개념적으로 verification하네스의 일부가 아닐까 생각되는데 결정적인 차이가 있을까요?
미해결
RAG 마스터: 기초부터 고급기법까지 (feat. LangChain)
vector = embeddings.embed_query(sample_text) 강의 진행을 위해서 어느정도의 비용을 지출하면 될까요? 감이 오지 않아서 문의 드립니다.ㅠㅠ
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 선생님. 연습문제 연습하고 있는데요 작업형2에서 선생님의 코드예시로 작성한 파일이랑 제가 만든 파일이랑 확률값의 소수점차이가 나는 이유는 무엇일까요?.. (사진첨부) 혹시 시험에는 무관한건지 여쭤봅니다
해결됨
Claude Code Harness & Graph Engineering 클로드코드 심화 CLI 하네스 엔지니어링 실무
안녕하세요 개념에 대해 조금 더 조사해보고 싶어서 질문 남깁니다! context harness 개념 소개 강의에서 띄워주신 자료에서 소개해주신 개념들에 대해 소개된 엔트로픽 공식문서나 웹에 공개된 자료가 있다면 소개 부탁드릴 수 있을까요? 팀의 하네스 구축하기 위한 근거자료로 삼고 싶어서요 꼭 부탁드립니다!