자료에서 시험환경 체험링크 : https://bit.ly/3H64wpG 여기 들어가면 페이지를 찾을 수 없습니다. 페이지의 주소가 잘못되었거나 변경되어요청한 페이지를 찾을 수 없습니다.입력하신 주소를 다시 한 번 확인해주시고문제가 반복되는 경우 아래 메일로 문의 부탁드립니다. 라고 에러가 뜹니다ㅠ 어떻게 해결할 수 있죠? 11회 빅데이터분서기사 실기시험 가이드pdf파일에 나와있는 https://dataq.goorm.io 여기에 미리 들어갈 수있는건가요? 로그인 하려니까 안되던데ㅠ 한국데이터산업진흥원 ID 비번이랑 동일한가요?? 감사합니다
10회 작업형2 타겟 변수(총가스사용량)는 일부 값이 0으로 기재되어 있으며, 이는 결측치를 대체한 값임. 관련하여 두번째 방법인 target=target[~cond] 로 했을때 오류가 줄어들어 더 좋은 값이면 이걸로 하는게 더 좋은건가요? 보통 결측치가 있을때는 그럼 결측치를 다른 값으로 대체하거나, 그렇게 하라고 문제에서 주어지나요? 그럼 fillna()로 사용해서 넣는건가요?
10회 기출 작업형1 1. 문제 1에서 df=df.groupby('sub_topic')['is_correct'].mean() df.sort_values('is_correct', ascending=False).drop_duplicates() 이렇게 했는데 오류가 나타나던데,, 이렇게 하면 안되는건가요? 해설에는 result = acc.sort_values(ascending=False).drop_duplicates() sort_values('컬럼명', ~~)이라고 보아서,, 해설처럼 ('컬럼명')을 안해도되나요? 2. 문제2-2에서 cond=df['year-month']=='2024-10' targetdata=df[cond] df.groupby('category')['price'].sum() 이렇게 해도 괜찮을까요? targetdata.groupby~ df.groupby 차이점을 정확하게 잘 르겠습니다ㅠ df를 일단 계속 쓰다보니까 헷갈려서요ㅠ 변수명 설정? 하는게 좀 헷갈리는 것 같습니다ㅠ groupby나 cond하고 나서 새로운 변수?로 설정하는것인가요? 뭔가 df=df~~랑 헷갈리는 것 같습니다ㅠ 좋은강의 감사드립니다!
데이터 전처리 과정에서 train= train.drop('customerID', axis=1) test = test.drop('customerID', axis=1) target=train.pop('TotalCharges') train = pd.get_dummies(train) test = pd.get_dummies(test) 이렇게 customerID를 drop하는 처리 진행 후 인코딩을 해서 학습 평가 까지는 잘 진행이 되는데, 예측단계(pred=rf.predict(test))에서 아래와같은value에러가 뜹니다. ValueError: The feature names should match those that were passed during fit. Feature names unseen at fit time: - customerID_CUST0001 이런 경우는 무조건 train과 test를 하나로 묶어서 원핫인코딩을 진행해야하나요? train, test 각각 개별로 진행하면 안되는 떄의 기준이 궁금합니다.
1. df.groupby(['지역코드','성별'])['총대출액'].sum() 그룹화할떄 지역코드, 성별 둘다 할때 보통 groupby('컬럼명') 인데 이때는 ( ) 안에 [ ] 이걸 해야하는건가요? 두개이상으로 그룹화할때 (['지역코드'], ['성별'] ) 이 아니라 (['지역코드', '성별'])인 이유가 있을까요 2. 1) "발생건수"와 "검거건수"를 따로 분리 cond1 = df['구분'] == "발생건수" cond2 = df['구분'] == "검거건수" df1 = df[cond1].iloc[:, 2:] df2 = df[cond2].iloc[:, 2:] 검거율을 바로 계산하지 않고, 따로 분리하는 이유가? 이해가 잘 안갑니다 3. df.groupby(['부서', '성과등급'])['근속연수'].mean() 이것과 df.groupby(['부서', '성과등급'])['근속연수'].transform("mean")이것은 다른가요? transform("mean")으로 써야하는건가요? df.groupby('기준컬럼')['값컬럼'].mean()이랑 df.groupby('기준컬럼')['값컬럼'].transform('mean')이랑 차이점을 잘 모르겠습니다 그럼 그룹별로 합계? 이런거 할떄도 df.groupby('기준컬럼')['값컬럼'].transform('sum') 이렇게 해야하나요? 뒤에 transform('')괄호 부분에 max,min 등등을 넣는건가요? 4. 각 직원의 '연봉 / 근속연수' 값을 계산하여, 그 값이 세 번째로 큰 직원의 근속연수 구할때 sort_values로 데이터 본 다음에 눈으로 본 값으로 알아서 1을 (loc 이런걸로 구하지 않고) a=1 이렇게 코딩해도 괜찮나요? 감사합니다
2회차 모의고사의 인강에서는 labelencoding을 사용후에 여러개의 모델을 사용하였는데, 꿀팁? 인강에서는 LGBM을 사용하면 obj 타입을 category로 변경만 해주면 된다고 하셨습니다. 어떤 방식이 더 낫고 맞는걸까요? 현재 상황은 라벨인코딩 사용 가능하며, 시험 때 랜덤포레스트와 LGBM을 사용하려 계획중입니다.
1. 유의하지 않은 독립변수 개수 구할때 summary보고 바로 8이라고 적어도되나요? print(sum(model.pvalues[1:] >0.05)) 이 코딩도 해야하는지 궁금합니다 2. 2-1, 2-2(결정계수) 구하는것도 그냥 summary 보고 바로 적어도되나요? 3. 반올림이나 정수 구하는것도 그냥 기본 수치 보고 코딩 안하고 바로 적어도되는지 궁금합니다. 점수엔 영향을 미치지 않나요? 감사합니다
안녕하세요 빠른 답변 감사드립니다. 저도 제가 뭘 잘못했는지 모르니 질문하는 것도 어려움이 있네요, 서버와 도메인 다시 구입해서 처음부터 다시 시작해보겠습니다. 기초 과정도 3번 다시 처음부터 하면서 대략적으로 n8n에 대해서 이해할 수 있었는데 서버관련된 것은 정말 어렵네요 제가 맥을 쓰고 있어서 호환되지 않는 프로그램과 설정때문인것 같기도 하고 제대로 안될 때 GPT 도움받는데 어쩔때는 해결이 되기도 하고 오류가 무한 반복이 되고 하면서 꼬인 듯합니다. 기초 과정에서 맥에서 가상으로 윈도우(페럴레리)를 쓰고 있어서 그냥 Railway를 사용하다가 결국은 도커에 다른 것들 설치하는 것에서 포기를 했었는데... 가상 윈도우에서도 도커가 재대로 설치가 되는지 궁금합니다
1. import pandas as pd df = pd.read _csv 이거 적는것은 (데이터 불러오는 것은) 시험에서 제공하고 있다고 했는데 (그럼 시험장에선 따로 안 적어도 되는것이죠?) 이 사이에 from sk.learn.preprocessing import MinMaxScaler 이건 매번 직접 적는건가요 2. train = train.drop('customerID', axis=1) test = test.drop(['customerID'], axis=1) target = train.pop('TotalCharges') ID를 drop안하고 그냥 타겟=만해도 되나요? 보통 그냥 tartget=~만 하는 것 같아서요 단순한(?) 질문만 하는것 같네요ㅠ 일단 쭉 빨리 들으면서,, 다시 복습하고자 합니다(조금씩 뭔가 알거는 같은데, 시간이 촉박하다 보니 빈틈이 생기는 것 같지만.ㅠ) 끝까지 열심히 하겠습니다 항상 좋은 강의 감사드립니다
안녕하세요. 언제나 수고가 많으십니다 :) ols나 logit 모델을 만들 때, 문제에서 ' 해당 변수가 범주형이라고 명시되어 있는 경우 '에만 변수에 C()를 감싸주라고 하셨는데요! 제가 궁금한 부분은 ' <<명시>> 가 정확히 무엇인지' 입니다. 예를 들어 시험 환경의 문제를 보면 아래와 같이 표현되어 있는데요. Pclass: 좌석 클래스 (1: 1등석, 2: 2등석, 3: 3등석) 위의 표현은 Pclass가 범주형이라고 명시되어 있는 것이라고 이해하고, Pclass 사용 시 C()로 감싸주면 될까요? 아니면 말그대로 문자로 "이 변수는 숫자이지만 범주형입니다."라고 적힌 것만 명시로 받아들어야 하나요?