체험환경에 코랩 노트북에서 제공한 데이터셋들을 올릴 수 있는 방법이 없을까요? 예를 들어 6회 기출문제 작업형1 데이터는 아래 링크입니다. df = pd.read _csv(" https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/6_1/data6-1-1.csv ")
import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv") 작업형1 연습문제마다 매번 파일 불러오는 게 친절하게 쉬프트 엔터만 누르면 되도록, 코드가 다 쓰여져 있더라구요. 실제 시험가도 파일 불러오는 거 코드는 따로 안외워가도 되나요??
자료에서 시험환경 체험링크 : https://bit.ly/3H64wpG 여기 들어가면 페이지를 찾을 수 없습니다. 페이지의 주소가 잘못되었거나 변경되어요청한 페이지를 찾을 수 없습니다.입력하신 주소를 다시 한 번 확인해주시고문제가 반복되는 경우 아래 메일로 문의 부탁드립니다. 라고 에러가 뜹니다ㅠ 어떻게 해결할 수 있죠? 11회 빅데이터분서기사 실기시험 가이드pdf파일에 나와있는 https://dataq.goorm.io 여기에 미리 들어갈 수있는건가요? 로그인 하려니까 안되던데ㅠ 한국데이터산업진흥원 ID 비번이랑 동일한가요?? 감사합니다
10회 작업형2 타겟 변수(총가스사용량)는 일부 값이 0으로 기재되어 있으며, 이는 결측치를 대체한 값임. 관련하여 두번째 방법인 target=target[~cond] 로 했을때 오류가 줄어들어 더 좋은 값이면 이걸로 하는게 더 좋은건가요? 보통 결측치가 있을때는 그럼 결측치를 다른 값으로 대체하거나, 그렇게 하라고 문제에서 주어지나요? 그럼 fillna()로 사용해서 넣는건가요?
10회 기출 작업형1 1. 문제 1에서 df=df.groupby('sub_topic')['is_correct'].mean() df.sort_values('is_correct', ascending=False).drop_duplicates() 이렇게 했는데 오류가 나타나던데,, 이렇게 하면 안되는건가요? 해설에는 result = acc.sort_values(ascending=False).drop_duplicates() sort_values('컬럼명', ~~)이라고 보아서,, 해설처럼 ('컬럼명')을 안해도되나요? 2. 문제2-2에서 cond=df['year-month']=='2024-10' targetdata=df[cond] df.groupby('category')['price'].sum() 이렇게 해도 괜찮을까요? targetdata.groupby~ df.groupby 차이점을 정확하게 잘 르겠습니다ㅠ df를 일단 계속 쓰다보니까 헷갈려서요ㅠ 변수명 설정? 하는게 좀 헷갈리는 것 같습니다ㅠ groupby나 cond하고 나서 새로운 변수?로 설정하는것인가요? 뭔가 df=df~~랑 헷갈리는 것 같습니다ㅠ 좋은강의 감사드립니다!
데이터 전처리 과정에서 train= train.drop('customerID', axis=1) test = test.drop('customerID', axis=1) target=train.pop('TotalCharges') train = pd.get_dummies(train) test = pd.get_dummies(test) 이렇게 customerID를 drop하는 처리 진행 후 인코딩을 해서 학습 평가 까지는 잘 진행이 되는데, 예측단계(pred=rf.predict(test))에서 아래와같은value에러가 뜹니다. ValueError: The feature names should match those that were passed during fit. Feature names unseen at fit time: - customerID_CUST0001 이런 경우는 무조건 train과 test를 하나로 묶어서 원핫인코딩을 진행해야하나요? train, test 각각 개별로 진행하면 안되는 떄의 기준이 궁금합니다.
1. df.groupby(['지역코드','성별'])['총대출액'].sum() 그룹화할떄 지역코드, 성별 둘다 할때 보통 groupby('컬럼명') 인데 이때는 ( ) 안에 [ ] 이걸 해야하는건가요? 두개이상으로 그룹화할때 (['지역코드'], ['성별'] ) 이 아니라 (['지역코드', '성별'])인 이유가 있을까요 2. 1) "발생건수"와 "검거건수"를 따로 분리 cond1 = df['구분'] == "발생건수" cond2 = df['구분'] == "검거건수" df1 = df[cond1].iloc[:, 2:] df2 = df[cond2].iloc[:, 2:] 검거율을 바로 계산하지 않고, 따로 분리하는 이유가? 이해가 잘 안갑니다 3. df.groupby(['부서', '성과등급'])['근속연수'].mean() 이것과 df.groupby(['부서', '성과등급'])['근속연수'].transform("mean")이것은 다른가요? transform("mean")으로 써야하는건가요? df.groupby('기준컬럼')['값컬럼'].mean()이랑 df.groupby('기준컬럼')['값컬럼'].transform('mean')이랑 차이점을 잘 모르겠습니다 그럼 그룹별로 합계? 이런거 할떄도 df.groupby('기준컬럼')['값컬럼'].transform('sum') 이렇게 해야하나요? 뒤에 transform('')괄호 부분에 max,min 등등을 넣는건가요? 4. 각 직원의 '연봉 / 근속연수' 값을 계산하여, 그 값이 세 번째로 큰 직원의 근속연수 구할때 sort_values로 데이터 본 다음에 눈으로 본 값으로 알아서 1을 (loc 이런걸로 구하지 않고) a=1 이렇게 코딩해도 괜찮나요? 감사합니다
2회차 모의고사의 인강에서는 labelencoding을 사용후에 여러개의 모델을 사용하였는데, 꿀팁? 인강에서는 LGBM을 사용하면 obj 타입을 category로 변경만 해주면 된다고 하셨습니다. 어떤 방식이 더 낫고 맞는걸까요? 현재 상황은 라벨인코딩 사용 가능하며, 시험 때 랜덤포레스트와 LGBM을 사용하려 계획중입니다.
1. 유의하지 않은 독립변수 개수 구할때 summary보고 바로 8이라고 적어도되나요? print(sum(model.pvalues[1:] >0.05)) 이 코딩도 해야하는지 궁금합니다 2. 2-1, 2-2(결정계수) 구하는것도 그냥 summary 보고 바로 적어도되나요? 3. 반올림이나 정수 구하는것도 그냥 기본 수치 보고 코딩 안하고 바로 적어도되는지 궁금합니다. 점수엔 영향을 미치지 않나요? 감사합니다
안녕하세요 빠른 답변 감사드립니다. 저도 제가 뭘 잘못했는지 모르니 질문하는 것도 어려움이 있네요, 서버와 도메인 다시 구입해서 처음부터 다시 시작해보겠습니다. 기초 과정도 3번 다시 처음부터 하면서 대략적으로 n8n에 대해서 이해할 수 있었는데 서버관련된 것은 정말 어렵네요 제가 맥을 쓰고 있어서 호환되지 않는 프로그램과 설정때문인것 같기도 하고 제대로 안될 때 GPT 도움받는데 어쩔때는 해결이 되기도 하고 오류가 무한 반복이 되고 하면서 꼬인 듯합니다. 기초 과정에서 맥에서 가상으로 윈도우(페럴레리)를 쓰고 있어서 그냥 Railway를 사용하다가 결국은 도커에 다른 것들 설치하는 것에서 포기를 했었는데... 가상 윈도우에서도 도커가 재대로 설치가 되는지 궁금합니다