3유형 질문드립니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
시험환경 예시문제를 보면 '독립성 검정을 실시했을 때 카이제곱 통계량은 ?'과 같이, 7회, 8회 문제에도 카이제곱인지, 로지스틱 회귀모형 등, 어떤 방법을 사용하라고 나왔었나요 ?
- python
- 머신러닝
- 빅데이터
- pandas
- 빅데이터분석기사
172만명의 커뮤니티!! 함께 토론해봐요.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
시험환경 예시문제를 보면 '독립성 검정을 실시했을 때 카이제곱 통계량은 ?'과 같이, 7회, 8회 문제에도 카이제곱인지, 로지스틱 회귀모형 등, 어떤 방법을 사용하라고 나왔었나요 ?
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
"train = pd.get_dummies(train) 로 사용해 주세요 train = pd.get_dummies(train[cols]) 를 사용하면 train에 기존에 있던 수치형은 삭제되고 없습니다."라는 무서운 답변을 방금 발견해서 아 맞다 세상에 하고 질문드리는데요 X_traintest_concat = pd.get_dummies(X_traintest_concat, columns=['fuelType']) 같이 하면 fuelType 컬럼만 원핫되고 다른 애들은 남아있는 거 맞죠? ㅠㅠㅠㅠ
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
기출 2회 작업형2 문제가 로지스틱 회귀로 분류문제라 랜포를 이용해서 풀이를 하려고 하는데요. 주어진 데이터가 3개라서 concat을 이용해서 X_train과 y_train을 train으로 합쳐서 하려고 하는데 잘 안됩니다ㅜ train = pd.concat([X_train, y_train['Reached.on.Time_Y.N']], axis=1) train.head(1) 이 코드에서 'Reached.on.Time_Y.N' 이 컬럼만 없고 나머지는 있어서 얘만 합쳐주는 건가요? # 데이터 불러오기 import pandas as pd test = pd.read_csv("X_test.csv") X_train = pd.read_csv("X_train.csv") y_train = pd.read_csv("y_train.csv") #주어진 데이터 3개라서 2개로 만들기(train합치기) train = pd.concat([X_train, y_train['Reached.on.Time_Y.N']], axis=1) train.head(1) # 3. 탐색적 데이터 분석(EDA) print(train.shape) #1490 print(test.shape) #497 print(train.info()) print(test.info()) print(train.head(3)) print(test.head(3)) print(train.isnull().sum()) print(test.isnull().sum()) print(train['Reached.on.Time_Y.N'].value_counts()) # 4. 데이터 전처리 print(train.info()) # 오브젝트형 있네?->인코딩하자 # print(train.shape, test.shape) train=pd.get_dummies(train) test=pd.get_dummies(test) # print(train.shape, test.shape) # print(train.info()) train = train.drop('ID', axis=1) test_id = test.pop('ID') test.head() # 5. 검증용 데이터 분할 *XXYY로* from sklearn.model_selection import train_test_split target = train.pop('Reached.on.Time_Y.N') X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=7) print(X_tr.shape, y_tr.shape, X_val.shape, y_val.shape) # 6. 검증 데이터 머신러닝 학습 및 평가 - 호출, 학습, 예측 from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=7) rf.fit(X_tr,y_tr) pred = rf.predict_proba(X_val) from sklearn.metrics import roc_auc_score roc_auc = roc_auc_score(y_val, pred[:,1]) print('roc_auc:',roc_auc) # 7. 예측 및 결과 파일 생성 pred=rf.predict_proba(test) print(pred[:10]) submit = pd.DataFrame({ 'ID': test_id, 'Reached.on.Time_Y.N': pred[:,1] }) submit.to_csv('result.csv',index=False) # 제출파일 확인 pd.read_csv('result.csv') pd.read_csv('result.csv').shape 꿀팁 영상 보고 주어진 데이터가 3개일 경우를 정리해본건데 코드가 많이 길지만 결과 나올 수 있게 코드 손 봐주시면 감사하겠습니다TT
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
np.exp(coef* 5) 라고 작성하셨는데, 5만큼 증가는 +5 아닌가요?? *5 는 곱하기 5 아닌가용?,,, *= + 라는 뜻인가요?
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
19개 종류를 다 비교 하기 쉽지 않습니다. 그리고 만약 train에 없는 고유값이 test에서 있으면 데이터를 합친다고 했는데, 범주형을 합쳐서 인코딩 한 다음에 다시 분리 할때는 loc, iloc 사용하나요? 그래서 처음 shape의 데이터 크기로 똑같이 맞춰야 하는거죠? 예를 들면 train.shape (6118,10) test.shape (1724,9) 라면 처음에 concat를 통해 6118+1724 로 해서 범주형 인코딩 하고 다시 원래 대로 크기를 쪼개야 하는거죠?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 가장 큰 값을 정수로 반올림하여 출력할 때, 이 2개 모두 사용해도 상관 없을까요? print(round(max(result))) print(round(result.max()))
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
랜덤포레스트 딱 하나만 공부하고 시험 쳐도 괜찮을까요? 여러 모델 학습법을 비교해서 우수 성능을 채택하는 것이 아니라서 결과적으로는 작업형2 만점을 못받을 수 잇을거 같긴한데, 내일이 시험이라 합격선만 딱 목표여서 그렇습니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
EDA를 할때 무엇을 알아내서 전처리를 해야하는지 너무 헷갈려요 결측치가 있는지 없는지 보고, 칼럼 갯수확인하고, 트레인과 테스트셋의 카테고리 수 비교 ? 이런것만하면될까요 ㅠㅠ.. 아직 EDA에서 전처리로 연결하는 감을 못잡겠어요..(큰일났어요...)
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형 2가 드뎌 정리된 듯하면서도 아직 어렵습니다ㅠㅠ
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
C()는 무조건 일원 이원 분산분석에서만 적용되나요? 다중 선형회귀나 앞부분 강의에서는 별도로 C()를 확인하지 못해서요
미해결
스프링 입문 - 코드로 배우는 스프링 부트, 웹 MVC, DB 접근 기술
[질문 내용] 안녕하세요, 강의 중에 궁금한점이 있어 글 남깁니다. 스프링 부트 스타터에 톰캣이 인베디드 되어서 저절로 가져오기 때문에 서버에 따로 톰캣을 설치할 필요가 없다고 하셨는데, 그렇다면 각 프로젝트를 서버에 띄우게 되면 모두 톰캣이 멀티 인스턴스로 띄우고 각 프로젝트는 모두 다른 포트를 사용해야하는걸까요? 만약 그렇다면 각 프로젝트에 톰캣 포트 세팅을 따로 해주어야하는데 해당 부분은 서버에서 하는게 아닌 프로젝트를 배포할때 세팅 파일에 따라 세팅이 되는 걸까요?
미해결
재고시스템으로 알아보는 동시성이슈 해결방법
Database JDBC URL [Connecting through datasource 'HikariDataSource (HikariPool-1)'] Database driver: undefined/unknown Database version: 8.3 Autocommit mode: undefined/unknown Isolation level: undefined/unknown Minimum pool size: undefined/unknown Maximum pool size: undefined/unknown 실행과 테이블 다 잘 만들어 지는데 이런 로그가 계속 뜹니다. 제 mysql 문제일까요? mac os 사용중이고 강의처럼 docker를 통해 띄우는게 아닌 홈브류로 mysql을 다운받아서 쓰고있었어서 그대로 쓰는중입니다
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요! 시험이 코앞으로 다가온 시점에서... 순차적으로 강의를 듣고 있는데 데이터 전처리(결측치/이상치 제거) 이후에 학습모델에 적용하기 위해 수치형 데이터들은 스케일링을, 범주형 데이터들은 인코딩을 해서 train 데이터를 만드는 것으로 이해하였습니다. 그다음 평가(예측)를 위해서 모델에 적용할때 ans = (y_test['income'] != '<=50K').astype(int) 와 같이 타겟값을 바꿔야하는 경우와 평가모델별로 predict, predict_proba 를 사용하는 경우가 정해져 있는건지 이 부분이 헷깔립니다 ㅜㅜ
해결됨
김영한의 실전 자바 - 고급 2편, I/O, 네트워크, 리플렉션
안녕하세요. 영한님의 자바 시리즈를 달리고 있는 수강생입니다. 혹시 고급 3편은 올해 12월 안에는 출시가 되는지 아니면 올해를 넘겨 2025년에 1-2월에 출시가 되는지 대략적인 시기가 궁금합니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 # your code import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p1/members.csv") df.head(3) df = df.sort_values('views',ascending=False).head(10) df r1 = 9690.0 df.iloc[:10,-1] = r1 cond = df['age'] >=80 print(df[cond]['views'].mean()) 안녕하세요 10번째 최소값을 r1= 9690.0 으로 지정 후 df.iloc[:10.-1] = r1로 지정후 결과를 냈더니 9690.0으로 나오는데 왜그런걸까요?
미해결
실전! 스프링 데이터 JPA
실전! 스프링데이터 jpa에서 8강을 듣고있는데 memberRepository 파일도 영상과 똑같이 코딩했는데 왜 안되는지 모르겠습니다
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업3을 위한 원포인트 레슨은 혹시 없을까요? 물론 범위가 광범위하다는 건 알지만, 그래도 혹시:::::
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
print(train.shape, test.shape) train = pd.get_dummies(train) test = pd.get_dummies(test) print(train.shape, test.shape) train = pd.get_dummies(train[cols]) test = pd.get_dummies(test[cols]) 아래처럼 cols로 범주형 칼럼을 인덱싱해서 넣지않고 위처럼해도 되나요? 수치형은 건드리지 않고 범주형에 대해서만 인코딩하기에 cols를 따로 하지 않아도 되나요?
미해결
자바 ORM 표준 JPA 프로그래밍 - 기본편
안녕하세요 엔티티를 준영속 상태로 만들면 1차 캐시에서 제거되고, 관련 SQL도 제거된다고 하셨는데 실제로 돌려보니까 insert 쿼리가 나가더라고요 실제 db에는 저장 되진 않았습니다. insert 쿼리가 나가는 이유가 무엇 때문일까요??
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요, 예시문제 작업형 3번의 2번 문제 풀이에서 질문있습니다! 여기에서 로지스틱회귀 분석을 위해 범주형 변수 중 인코딩이 되지 않은 Gender 변수에 C(Gender)를 붙이셨더라구요 혹시 인코딩되지 않은 변수의 앞에 C를 붙이는 것이 필수로 수행되어야하는것일까요? 제가 궁금해서 C를 붙이지 않고 모델썸머리를 출력하고 값을 비교해봤는데 모든 표값이 같기는 했습니다. 만약, 필수로 C를 붙여주어야한다면 로지스틱회귀분석 뿐만아니라 분산분석(일원/이원)에도 모두 붙여주어야 할까요?