오브젝트형 데이터가 많은 문제 관련
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요. 오브젝트가 대부분인 데이터인데, 오브젝트를 드랍한 게 인코딩 했을 때보다 점수가 더 좋게 나오는 경우.. 그냥 드랍해서 모델 학습시켜도 되는 걸까요? 전에 다른 회차에서도 하나만 수치형 데이터인데 그 수치형 데이터만으로 예측한 게 점수가 더 좋게 나왔었어요..!
- python
- 머신러닝
- 빅데이터
- pandas
- 빅데이터분석기사
173만명의 커뮤니티!! 함께 토론해봐요.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요. 오브젝트가 대부분인 데이터인데, 오브젝트를 드랍한 게 인코딩 했을 때보다 점수가 더 좋게 나오는 경우.. 그냥 드랍해서 모델 학습시켜도 되는 걸까요? 전에 다른 회차에서도 하나만 수치형 데이터인데 그 수치형 데이터만으로 예측한 게 점수가 더 좋게 나왔었어요..!
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선생님, 지금까지 코랩이나 주피터에서 연습할때는 프린트 없이 출력하면 데이터테이블 형태로 나와서 보기 편했는데, 체험환경은 프린트를 무조건 넣으면 시리즈로 나와서 보기 불편한데, 이걸 데이터프레임형식으로 보는 방법이 있나요...? ㅠㅠ
미해결
쿠버네티스 어나더 클래스-Sprint 1, 2 (#실무기초 #설치 #배포 #Jenkins #Helm #ArgoCD)
[ 👍 좋은 질문을 했을 때 좋은 답변이 돌아 옵니다] 안녕하세요 일프로님! 혼자서 해결해보려다가 하루종일 해봤는데 계속 같은 문제가 반복 되어서 질문드립니다. 현재까지 트러블 슈팅 해본 경험으로는 VM의 시스템 단의 문제 인걸로 파악이 됩니다. 계속해서 일어나는 현상이 VM이 CPU 사용률이 높아서 K8s kube-system 내의 오브젝트들이 죽는 것이 반복 되는데 죽었다 살았다가 지속 되다가 VM도 멈춰버립니다. 이 환경을 최적화 하고 리소스 낭비가 있는 곳이 있다면 줄여서 정상적으로 실습을 하고 싶습니다. 참고로 제 노트북은 14코어에 렘 16Gb 입니다. CPU는 CICD 서버와 master node가 있는 서버가 돌아가도 50% 미만으로 여유가 있습니다. 렘 사용률은 90% ~ 95% 정도를 유지합니다. 1. 실습 중 본인의 환경이 가이드와 다른 부분이 있었다면 말씀해주세요. Jenkins step3 blue-green 배포 진행 하다가 VM이 커널이 뻗어 버려서 리소스들이 부족한가 생각이 들어서 VM 종료 후 VitualBox 설정에서 VCPU 프로세서를 6 -> 12로 고쳐 다시 기동했습니다. Deployment들이 startupProbe 밑 설정들이 파드 로그들을 봤을 때 java 앱 기동도 전에 재시작이 되어 10초마다 60번 까지 체크 하는 걸로 고쳤습니다. 2. 해당 문제의 발생 빈도(재설치 여부)와 문제 해결을 위해 시도해본 케이스를 말씀해 주시면 원인 파악에 큰 도움이 됩니다. 지속적으로 VM에 문제가 발생합니다. [root@k8s-master ~]# kubectl get pod NAME READY STATUS RESTARTS AGE app-1-2-2-1-78cbbff668-7vkls 0/1 Unknown 1 2d app-1-2-2-1-78cbbff668-jvzxq 0/1 Error 5 2d [root@k8s-master ~]# Message from syslogd@k8s-master at Jun 12 15:42:16 ... kernel:watchdog: BUG: soft lockup - CPU#2 stuck for 21s! [portmap:50410] 커널이 멈춰버리는 치명적인 버그가 있어서 검색해보니 사용 중인 리눅스 배포판(Rocky Linux 등)의 커널 버전에 알려진 버그일 수 있다고 들었습니다. 그래서 sudo dnf update -y 위 명령어로 커널 업데이트 했습니다. 업데이트 후에도 계속에서 top으로 조회 해도 cpu 사용률이 100% 를 넘어 가는 경우가 많아서 그럴 때 마다 여러번 VM을 재시작했습니다. 재시작 후 kubelet 과 containerd 도 재시작 하고 정상작동할 때 까지 기다리고 실습을 다시 진행했습니다. 혹시나 전에 배포 했던 오브 젝트들이 차지 하고 있는 리소스 때문에 그런가 해서 anotherclass-2** 으로 시작하는 네임 스페이스들을 anotherclass-221 제외하고 모두 삭제했습니다. 3. 에러 메시지만 봐서는 저도 모르는 경우가 많아요. 그전에 했던 작업이 포함된 캡쳐 화면도 부탁 드려요. 반복해서 kubeapi-server가 죽습니다. 제 기동 되면 다시 kubectl 명령어가 됬다가 일정 시간이 지나고 다시 재시작 됩니다. 그 동안 VM 이 느리지 않았는데 오늘 실습을 하고나서 kubectl 명령실행 시 꽤나 시간 약 (5초~30초) 후에 실행이 되거나 60초가 지나서 명령이 실행되지 않습니다. AI 한테 kube-apiserver 에러로그를 보여주고 답변 받은 내용도 보냅니다 3번 overflow는 2번 이 발생 해서 일어나는 현상이라고 생각이 되어서 3번 오류에 대한 AI 의 답변은 캡쳐 하지 않았습니다. 4. 영상 내용에 대한 질문 시 해당 시간을 같이 올려 주시면 답변을 드리는 시간이 더 빨라집니다. 5. 긴 로그는 제 메일로 보내주세요. ( k8s.1pro@gmail.com ) 6. 카페 [ 강의 자료실 ]에도 많은 질문과 답변들이 있어요!
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요 책과 강의 구매후 공부중입니다. 책에 챕터3에 연습문제가 있는데요, 해당 문제는 강사님의 깃허브에서 파일이 있더라구요. 그리고 캐글에도 다른 연습문제가 있는거 같은데.. 두 곳에서 문제를 다 풀면 좋지만, 시간 여건상 하나만 선택해야 한다고 했을때, 어느 문제를 풀어보는게 좋을까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
예시문제 작업형 2를 풀다 생긴 질문인데요. train_test_split함수에 들어있는 random_state값이 바뀔때 마다 평가지표의 값이 눈에 띄게 달라지는데 정상인가요? 0일땐 800초반대, 1일땐 1100중반대가 나오는데, 이정도면 꽤나 차이가 나는게 아닌지요? +시험 현장에선 random_state 값을 두세개 넣어보는게 좋을까요?
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
강사님 말씀하신 아래 방법 외에 train = pd.get_dummies(train) test = pd.get_dummies(test)는 안되는건가요? 이것도 원핫인코딩과 동일한데 확인부탁드립니다. # [선택2] 원핫 인코딩 (카테고리가 다르면 합쳐서 진행 필요함) # df = pd.concat([train, test]) # df = pd.get_dummies(df) # # 다시 분리 # train = df.iloc[:len(train)] # test = df.iloc[len(train):] # print(train.shape, test.shape)
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 p-value 값을 구할때, 반올림하거나 정수를 구하라 이런말 없으면 그냥 카이제곱검정했을 때 나온 소숫점 자리수 전부 다 입력해야하나요? 하나라도 빠지면 틀리는걸까요? 자리수 명시가 명확하지않는경우도 있나요?
해결됨
쿠버네티스 어나더 클래스-Sprint 1, 2 (#실무기초 #설치 #배포 #Jenkins #Helm #ArgoCD)
안녕하세요. 젠킨스 파이프라인 기본 구성 및 배포 세분화 강의를 보던 중 궁금한 점이 생겨 질문을 남기게 되었습니다. 강의 영상의 8분 25초쯤을 보시면, Github project에 Project url을 지정하는 곳이 보입니다. 그리고, 9분쯤에 Repository URL이라는 부분도 보입니다. 이 두 속성의 차이점이 궁금합니다. 제 개인적인 생각으로는 Project URL의 경우 해당 Repo가 Private일 경우 Jenkins에서 접근할 방법이 없기 때문에 단순히 명세의 개념이라고 생각했습니다. 반대로, 실제로 Project 소스를 가져오기 위해 참조되는 것은 Credentials 속성을 가지고 있는 Repository URL일 것이구요. 혹시나, 제가 잘못 알고 있는 부분이 있다면 알려주시면 감사하겠습니다 !!
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
10분 4초에서 합동분산추정량을 구할 때 자유도는 sum을 쓰시고 그 전 1번 문제에서 자유도를 구하실 때는 len으로 하셨는데, 차이가 있을까요??
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
1유형이랑 3유형에서 소문제가 여러 개 있을 때 답을 하나씩 옮겨적는다고 하면 문제 1-1 답안 적고 1-2 답 확인하러 코드로 넘어가면 1-1 답안 유지되나요 아니면 사라지나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
분류모델의 경우 평가값이 0.9언저리면 괜찮은것으로 알고 있는데 회귀모델의 경우 평가지표 값이 r2같은것 제외하고는 mae,rmse등은 낮은것이 좋은것으로 알고있습니다 근데 평균의 10%이하 정도 보통 좋은것으로 알고있는데 어떤값이 좋은지 어떻게 비교할수 있나요??
해결됨
실전! Django 입문 [최신 5.2 버전]
가상환경을 맞추는 작업(확인)을 하지 않으면 어떤 문제가 생기는지요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
혹시 수치형과 범주형데이터를 분리했다가 합치지 말고, 바로 원핫인코딩을 진행해서 해도 괜찮을까요? 또, max_depth도 꼭 필요한지, 어디서 적용해야하는지도 궁금합니다
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요. 수강중 문의드립니다 전처리 파트 중 인코딩 부분에서, 인코딩 했을 때 칼럼수가 너무 많아질 경우 원핫 말고 라벨인코더를 사용하는데요 시험장 컴퓨팅 환경을 기준으로 컬럼이 몇개 오버될경우 라벨인코더를 사용하면 좋을지 에대해 기준점을 제시해주시면 감사하겠습니다.(현재 200개 언더로는 원핫 쓰고 그이상은 라벨인코더 쓰는 식으로 하고있습니다)
미해결
쿠버네티스 어나더 클래스-Sprint3 (#실무핵심 #Docker #Nginx #Minio #Longhorn)
인그레스서비스를 blue/green 배포하는 것은 잘 이해했습니다. 그럼 만약 ArgoCD를 여기에 사용 가능한지도 궁금합니다. 일반적인 blue/green 배포에서는 ArgoCD가 레이블을 자동으로 조정하는 것으로 알고 있는데 인그레스에서는 어떻게 동작하는지 설명 부탁드릴 수 있는지요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
import pandas as pd train = pd.read _csv("data/customer_train.csv") test = pd.read _csv("data/customer_test.csv") # 사용자 코딩 # print(train.shape, test.shape) # print( train.info ()) # print(test.isnull().sum()) y_train = train.pop('총구매액') # print(train.shape, test.shape) m = train['환불금액'].mean() train['환불금액'] = train['환불금액'].fillna(m) test['환불금액'] = test['환불금액'].fillna(m) # 원핫, 라벨링인코더 # print( train.info ()) # print(train.shape, test.shape) #라벨인코더 # cols = ['주구매상품', '주구매지점'] # from sklearn.preprocessing import LabelEncoder # le = LabelEncoder() # for col in cols: # train[col] = le.fit _transform(train[col]) # test[col] = le.transform(test[col]) #원핫 print(train.shape, test.shape) data = pd.concat([train,test], axis = 0) data_oh = pd.get_dummies(data) train = data_oh.iloc[:len(train)].copy() test = data_oh.iloc[len(train):].copy() print(train.shape, test.shape) # print(train.head()) #스플릿 from sklearn.model_selection import train_test_split X_tr, X_var, y_tr, y_var = train_test_split(train, y_train, test_size = 0.15, random_state = 0) #랜포 from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state=0) rf.fit (X_tr, y_tr) pred = rf.predict(X_var) import lightgbm as lgb lgbmr = lgb.LGBMRegressor(random_state=0) lgbmr.fit (X_tr, y_tr) pred1 = lgbmr.predict(X_var) from sklearn.metrics import root_mean_squared_error rmse = root_mean_squared_error(y_var, pred1) print(rmse) #라벨 rf 716.2595627489613 #라벨 lgb 667.9290102574973 #원핫 rf - 762.9476701424611 #원핫 lgb - 652.1802049238468 #제출 pred = lgbmr.predict(test) submit = pd.DataFrame({'pred' : pred}) submit.to _csv('result.csv', index=False) print( pd.read _csv('result.csv')) 저렇게 4개 비교해서 원핫 lgb로 제출했는데요 옳게 했는지 코드 점검 한번만 부탁드립니다 그리고 질문이 있는데요 실제 시험 들어가면 import pands as pd랑 트레인 테스트 저거 주나요? 외워야하나요? 저 화면 처럼 실제 시험도 저렇게 구성되어있나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
train과 test 데이터 전처리 시, 두 데이터 모두에서 '총구매액' 과 '최대구매액'이 음수이길래 이상치인줄 알고 전처리에 고민을 좀 했습니다. 고민하다보니 전액 환불한 경우에는 논리적으로 음수가 맞더라고요. 그래서 별도의 이상치 처리는 안 했습니다. 다만, 제가 궁금한점은 실제 시험에서 이상치가 나왔을 때 대응 방법 (예를 들어, 이상치가 아닌 데이터만 살리는 등) 이 문제처럼 test데이터에서 이상치가 나올 가능성이 있는지와 대응방법 (test데이터의 행은 삭제해서는 안 되는 것으로 알고 있습니다.) 위 두가지가 궁금합니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
예측 단계에서 다음과 같은 오류가 발생했는데, 이유가 뭘까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
ValueError Traceback (most recent call last) /usr/local/lib/python3.11/dist-packages/pandas/core/indexes/range.py in get_loc(self, key) 412 try: --> 413 return self._range.index(new_key) 414 except ValueError as err: ValueError: 3 is not in range The above exception was the direct cause of the following exception: KeyError Traceback (most recent call last) 3 frames /usr/local/lib/python3.11/dist-packages/pandas/core/indexes/range.py in get_loc(self, key) 413 return self._range.index(new_key) 414 except ValueError as err: --> 415 raise KeyError(key) from err 416 if isinstance(key, Hashable): 417 raise KeyError(key) KeyError: 3 기출3회 작업형1 3번 문제를 풀 때, 맨 처음 데이터를 다시 실행시켜주지 않으면 동일한 코드라도 이런 오류가 뜹니다. 매번 처음 데이터를 실행해줘야하나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 방법 2인 pivot table을 만든 이후에 기존 방법 1의 grouped['차이'] 항목을 만들어 처리하였는데요. 방법 2에서는 grouped라는 변수에 pivot table 결과를 안넣으셨는데, pivot table 결과가 어떻게 grouped에 들어간걸까요??