https://dataq.goorm.io/exam/116674/체험하기/quiz/4 여기서 하는 성별예측 문제에서 import pandas as pd train = pd.read _csv("data/customer_train.csv") test = pd.read _csv("data/customer_test.csv") # print(train.shape, test.shape) # print( train.info ()) # print(train.isnull().sum()) # print(test.isnull().sum()) #결측치 처리 (환불금액) train['환불금액'] = train['환불금액'].fillna(0) test['환불금액'] = test['환불금액'].fillna(0) # print(test.isnull().sum()) # print(train['성별'].value_counts()) #인코딩 target = train.pop('성별') train = pd.get_dummies(train) test = pd.get_dummies(test) #검증 데이터 분리 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) # print(X_tr.shape, X_val.shape, y_tr.shape, y_val.shape) from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=0) rf.fit (X_tr, y_tr) pred = rf.predict_proba(X_val) # print(pred) from sklearn.metrics import roc_auc_score roc = roc_auc_score(y_val, pred[:,1]) #예측 및 파일생성 pred = rf.predict_proba(test) submit = pd.DataFrame({ "pred":pred[:,1] }) submit.to _csv("result.csv", index=False) # print( pd.read _csv("result.csv")) 이렇게 코딩을 했는데 예측 및 파일 생성에서 pred = rf.predict_proba(test) 여기 부분이 오류가 뜨는데 왜 그런가요 ㅠㅠ > Makefile:6: recipe for target 'py3_run' failed make: *** [py3_run] Error 1 Traceback (most recent call last): File "/goorm/Main.out", line 43, in <module> pred = rf.predict_proba(test) File "/usr/local/lib/python3.9/dist-packages/sklearn/ensemble/_forest.py", line 674, in predict_proba X = self._validate_X_predict(X) File "/usr/local/lib/python3.9/dist-packages/sklearn/ensemble/_forest.py", line 422, in validate X_predict return self.estimators_[0]._validate_X_predict(X, check_input=True) File "/usr/local/lib/python3.9/dist-packages/sklearn/tree/_classes.py", line 407, in validate X_predict X = self._validate_data(X, dtype=DTYPE, accept_sparse="csr", File "/usr/local/lib/python3.9/dist-packages/sklearn/base.py", line 437, in validate data self._check_n_features(X, reset=reset) File "/usr/local/lib/python3.9/dist-packages/sklearn/base.py", line 365, in check n_features raise ValueError( ValueError: X has 73 features, but DecisionTreeClassifier is expecting 74 features as input. 이렇게 뜹니다,,
안녕하세요. 좋은 강의 감사드립니다. 덕분에 잘 배우고 있습니다. 문제 2. 주어진 데이터에서 결측치가 30%이상 되는 컬럼을 찾고 해당 컬럼에 결측치가 있는 데이터(행)를 삭제 함. 그리고 30% 미만, 20% 이상인 결측치가 있는 컬럼은 최빈값으로 값을 대체하고 'f3'컬럼의 'gold' 값을 가진 데이터 수를 출력하세요! 문제2를 대하고 순간 다음과 같은 고민을 했었습니다. 1번을 수행하여 'f1'컬럼의 결측치 행을 삭제한 후 2번을 하려니 'f3'컬럼의 결측치 갯수가 18개만 남더군요. 그럼 18개는 최초 데이터 100개의 20% 미만일까? 그렇지 않다. 'f1'컬럼 결측치를 제거한 후 데이터 갯수 69개의 20%~30%(14~20)에 해당한다. 그렇다면 'f3'컬럼의 최빈 값은 'f1'컬럼의 결측치를 제거하기 전의 값을 사용해야할까 아니면 결측치 제거 후의 값을 사용해야 할까? 결과적으로는 어떤 방식으로 하던 답은 56으로 일치했지만 주어진 데이터에 따라 다른 값이 나올 수도 있을 것 같습니다. 혼돈을 없애기 위해 문제 2의 문항 순서를 바꾸면 어떨까요? 30% 미만, 20% 이상인 결측치가 있는 컬럼은 최빈값으로 값을 대체하고 주어진 데이터에서 결측치가 30%이상 되는 컬럼을 찾고 해당 컬럼에 결측치가 있는 데이터(행)를 삭제 함. 'f3'컬럼의 'gold' 값을 가진 데이터 수를 출력하세요!
안녕하세요. 정말 좋은 강의덕분에 무사히 lambda에서 ec2로 클라우드 이관을 완료했습니다. 몇가지 고민 및 문의사항이 있어 글 남깁니다. 1. 지금까지 강의에서 배운 내용으로만 유저 1000명 이하인 서비스 운영이 가능할까요? - 지금까지 강의에서 다룬 프리티어 버전의 ec2, rds등에 대한 성능 측정을 어떤 식으로 진행해야 하는지 감이 안잡혀서 질문이 조금 추상적인점 양해 부탁드립니다. 2. 1번 질문이 추상적인 것 같은데, 혹시 지금 강의의 인스턴스 스펙에 대해서 성능을 측정할 수 있는 방법에는 어떤 것들이 있을까요? - ec2에 배포한 프로젝트의 아무 api를 잡고, jmeter등으로 성능 측정을 해보면 될까요? 아니면 더 정확하게 측정할 수 있는 다른 방법이 있을까요? - rds 관련해서 성능 측정은 어떤 툴이나 방법이 있는지도 궁금합니다. 3. 다른 글들을 찾아보면 vpc, elb, docker를 통해 아키텍처를 구성하는 것 같은데 각 기술에 맞는 도입시기 등은 언제일까요? 4. 이 강의를 다 들은 후에 클라우드 관련해서 어떤 걸 추가로 학습하면 좋을까요?
안녕하세요. 현재 진행중인 사이드 프로젝트(springboot)에서 lambda를 사용해서 활용중인데, ec2로 이관하려고 해당 강의를 시청중입니다. ec2로 이관하면서 ci/cd도 다시 구축해야 하는데, jenkins를 활용하려고 합니다. 그 과정에서 아래 고민(질문)들이 있어서 문의드립니다. 1. 일반적으로 application구동할 ec2 인스턴스를 생성하고, jenkins는 별도의 ec2인스턴스를 생성해서 구축하는게 올바른걸까요? 2. 프리티어로 ec2인스턴스를 2개 생성하게 되면 과금은 어떤 방식으로 이뤄지는지에 대해서 확인할 수 있는 자료가 있을까요?
안녕하세요 강사님. 강의를 잘 들었습니다. practitioner부터 SA까지 강의 듣고 자격증 취득에 큰 도움 되었습니다~ 실무단에서 소소한 영역들 적용해보기 시작하려는데, 이론으로만 보고 막상 하려니 어렵네요! 강의 내용에서 실습 내용들을 짬짬이 더 보고 싶은데, 강의 기간 연장해주실 수 있을까요?
자바와 스프링 부트로 생애 최초 서버 만들기, 누구나 쉽게 개발부터 배포까지! [서버 개발 올인원 패키지]
이번에 배포까지 완료 하였고, 많이 부족하지만 이 강의를 통하여 배운 것을 기반으로 응용 프로젝트를 하려고 합니다. 목표는 웹 앱 하이브리드 형식으로 웹에서는 관리자 관리 기반 기능 (책 등록, 회원 승인, 기록 관리) 앱에서는 로그인이나 ai 가 책을 추천하고, 책에 대한 소통하는 게시판, 웹에서 등록된 책을 앱에서 대출 및 반납 을 목표로 하고 있습니다. 예전에 js, css 를 다뤄서 html 을 만들어본 경험과 안드로이드 스튜디오를 통해 heidiSQL 을 사용하여 알람 앱을 만들어 본 적도 있는데, 다 까먹었지만, 다시 한번 기억을 되살려 써먹어보고 싶습니다. 문제는 일단 프론트 쪽 부터 뜯어보고 싶은데, 제가 배웠던 것은 js와 css 파일을 나누어서 그것을 이용해 body에 때려박는 무식한 방식으로 했는데 idex.html 에 있는 body 에 id="root" 만 있고 이 root 에 대한 값을 못찼겠네요... 일단 제가 알고 싶은 것은 버튼이나 여러 ui를 추가 하고 싶은데 혹시 강의에서 주신 html 을 건들려면 어떻게 해야 할지 알 수 있을까요? 서버 실행 후 index.html 에 있는 저장 버튼이 어떻게 저희가 작성한 코드와 상호작용 되는지 알 수 있을까요?
ec2에 개별적으로 docker run jpr파일을 띄우고 docker stop을 하고 다 지우고 통합 관리를 위해 docker compose yml에서도 같은 jpr파일을 적어서 docker compose up하면 안됩니다... ec2안데 개별적으로 docker run하면 됩니다. ..
Beanstalk로 생성한 EC2 type이 t2.micro인데 memory 부족으로 업그레이드를 생각하고 있습니다. 가장 걱정되는건 업그레이드를 할때 기존 EC2와 타입이 안맞던지, 연결되어 있던 네트워크나 ELB, 도메인, 스토리지 등의 구성이 깨지면 복구를 할수있는 지식이 없기 때문에 불안해서 못 하고 있습니다. 강사님의 t 타입 영상을 봐도 잘 이해가 안가고 CloudWatch지표를 보라고 하셨는데 봐도 잘 모르겠네요 도움 부탁 드립니다.
안녕하세요 강사님 올해 말 실기 시험 목표로 강의를 수강 중인 학생입니다. 강의 수강 중 문득 걱정이 되는게 있어서 문의 드립니다. 맥북 단축키 같은것도 알려주시고 당장 수강하는데는 별 문제없다고 생각하는데, 시험장에 맥북을 들고 갈 순 없는 노릇이니.. 혹시 맥북으로 공부해 갔을때 발생할 수 있는 문제와 그에 대처방법이 혹시 있을까요?
빅데이터/텍스트마이닝 분석법 (LDA,BERTtopic,감성분석,CONCOR with ChatGPT)
안녕하세요 선생님 제가 LDA분석방법으로 연구를 진행중인데 이 LDA분석 방법의 단점을 개선한 방법으로 딥러닝 방식인 BERTopic 분석 방법이 최근 등장해서 연구논문에 조금씩 등장하는걸 확인했습니다. 그래서 이 분석 방법에 흥미가 생겨 어떻게 할 수 있는지 인터넷, 책 등을 아무리 찾아봐도 직접적으로 연구에 어떻게 적용해서 하는 건지, 딥러닝 방식이라 학습시키는 데이터(말뭉치)는 또 어떻게 준비하는 건지.. 도통 모르겠고 도움을 받을 수 있는 길이 없는거 같아서 답답한 마음에 한번 여쭤봅니다. 혹시 연구논문에 적용가능한 BERTopic 분석 방법에 대한 강의를 올려주실 계획은 없으실지 궁금합니다!
안녕하세요 비전공자 직장인입니다. 퇴근후 딴짓 님 강의를 열심히 듣고 있습니다. 현재 작업형2 모의문제 2를 혼자서 풀고 있는데, 단순한 결측치 찾고, 샘플 찾고, 그런 것들은 하겠는데 이거를 모델링 하는 거에서부터 사실 멘붕입니다. 작업형1 모의문제를 풀 때도 똑같이 강의를 듣던것보다 더 어려워서 멘붕이 왔었습니다. 일단은 모르겠는 부분은 인지한 상태로 다시 반복하겠다는 의지로 계속 강의를 듣는 게 맞겠죠? 반복이 답이겠죠??
선생님, 강의 열심히 보고 있는데 제가 5월 중순부터 시작하면서 조금 일찍 시작했는데도 불구하고 암기 할 게 너~~~~~~무 많아서 큰일입니다 ㅠㅠ 단권화 시키려고 실기용 교재를 샀는데 정말 정말 이것만큼은 꼭! 외우고 가야하는 코드나 문법같은거를 정리해주실 수 있나요? (강의나...파일로) 사실 고득점 합격은 바라지도 않고 60점 턱걸이로라도 너무 붙고싶습니다!