https://dataq.goorm.io/exam/116674/체험하기/quiz/4 여기서 하는 성별예측 문제에서 import pandas as pd train = pd.read _csv("data/customer_train.csv") test = pd.read _csv("data/customer_test.csv") # print(train.shape, test.shape) # print( train.info ()) # print(train.isnull().sum()) # print(test.isnull().sum()) #결측치 처리 (환불금액) train['환불금액'] = train['환불금액'].fillna(0) test['환불금액'] = test['환불금액'].fillna(0) # print(test.isnull().sum()) # print(train['성별'].value_counts()) #인코딩 target = train.pop('성별') train = pd.get_dummies(train) test = pd.get_dummies(test) #검증 데이터 분리 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) # print(X_tr.shape, X_val.shape, y_tr.shape, y_val.shape) from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=0) rf.fit (X_tr, y_tr) pred = rf.predict_proba(X_val) # print(pred) from sklearn.metrics import roc_auc_score roc = roc_auc_score(y_val, pred[:,1]) #예측 및 파일생성 pred = rf.predict_proba(test) submit = pd.DataFrame({ "pred":pred[:,1] }) submit.to _csv("result.csv", index=False) # print( pd.read _csv("result.csv")) 이렇게 코딩을 했는데 예측 및 파일 생성에서 pred = rf.predict_proba(test) 여기 부분이 오류가 뜨는데 왜 그런가요 ㅠㅠ > Makefile:6: recipe for target 'py3_run' failed make: *** [py3_run] Error 1 Traceback (most recent call last): File "/goorm/Main.out", line 43, in <module> pred = rf.predict_proba(test) File "/usr/local/lib/python3.9/dist-packages/sklearn/ensemble/_forest.py", line 674, in predict_proba X = self._validate_X_predict(X) File "/usr/local/lib/python3.9/dist-packages/sklearn/ensemble/_forest.py", line 422, in validate X_predict return self.estimators_[0]._validate_X_predict(X, check_input=True) File "/usr/local/lib/python3.9/dist-packages/sklearn/tree/_classes.py", line 407, in validate X_predict X = self._validate_data(X, dtype=DTYPE, accept_sparse="csr", File "/usr/local/lib/python3.9/dist-packages/sklearn/base.py", line 437, in validate data self._check_n_features(X, reset=reset) File "/usr/local/lib/python3.9/dist-packages/sklearn/base.py", line 365, in check n_features raise ValueError( ValueError: X has 73 features, but DecisionTreeClassifier is expecting 74 features as input. 이렇게 뜹니다,,
안녕하세요. 좋은 강의 감사드립니다. 덕분에 잘 배우고 있습니다. 문제 2. 주어진 데이터에서 결측치가 30%이상 되는 컬럼을 찾고 해당 컬럼에 결측치가 있는 데이터(행)를 삭제 함. 그리고 30% 미만, 20% 이상인 결측치가 있는 컬럼은 최빈값으로 값을 대체하고 'f3'컬럼의 'gold' 값을 가진 데이터 수를 출력하세요! 문제2를 대하고 순간 다음과 같은 고민을 했었습니다. 1번을 수행하여 'f1'컬럼의 결측치 행을 삭제한 후 2번을 하려니 'f3'컬럼의 결측치 갯수가 18개만 남더군요. 그럼 18개는 최초 데이터 100개의 20% 미만일까? 그렇지 않다. 'f1'컬럼 결측치를 제거한 후 데이터 갯수 69개의 20%~30%(14~20)에 해당한다. 그렇다면 'f3'컬럼의 최빈 값은 'f1'컬럼의 결측치를 제거하기 전의 값을 사용해야할까 아니면 결측치 제거 후의 값을 사용해야 할까? 결과적으로는 어떤 방식으로 하던 답은 56으로 일치했지만 주어진 데이터에 따라 다른 값이 나올 수도 있을 것 같습니다. 혼돈을 없애기 위해 문제 2의 문항 순서를 바꾸면 어떨까요? 30% 미만, 20% 이상인 결측치가 있는 컬럼은 최빈값으로 값을 대체하고 주어진 데이터에서 결측치가 30%이상 되는 컬럼을 찾고 해당 컬럼에 결측치가 있는 데이터(행)를 삭제 함. 'f3'컬럼의 'gold' 값을 가진 데이터 수를 출력하세요!
안녕하세요 강사님 올해 말 실기 시험 목표로 강의를 수강 중인 학생입니다. 강의 수강 중 문득 걱정이 되는게 있어서 문의 드립니다. 맥북 단축키 같은것도 알려주시고 당장 수강하는데는 별 문제없다고 생각하는데, 시험장에 맥북을 들고 갈 순 없는 노릇이니.. 혹시 맥북으로 공부해 갔을때 발생할 수 있는 문제와 그에 대처방법이 혹시 있을까요?
빅데이터/텍스트마이닝 분석법 (LDA,BERTtopic,감성분석,CONCOR with ChatGPT)
안녕하세요 선생님 제가 LDA분석방법으로 연구를 진행중인데 이 LDA분석 방법의 단점을 개선한 방법으로 딥러닝 방식인 BERTopic 분석 방법이 최근 등장해서 연구논문에 조금씩 등장하는걸 확인했습니다. 그래서 이 분석 방법에 흥미가 생겨 어떻게 할 수 있는지 인터넷, 책 등을 아무리 찾아봐도 직접적으로 연구에 어떻게 적용해서 하는 건지, 딥러닝 방식이라 학습시키는 데이터(말뭉치)는 또 어떻게 준비하는 건지.. 도통 모르겠고 도움을 받을 수 있는 길이 없는거 같아서 답답한 마음에 한번 여쭤봅니다. 혹시 연구논문에 적용가능한 BERTopic 분석 방법에 대한 강의를 올려주실 계획은 없으실지 궁금합니다!
안녕하세요 비전공자 직장인입니다. 퇴근후 딴짓 님 강의를 열심히 듣고 있습니다. 현재 작업형2 모의문제 2를 혼자서 풀고 있는데, 단순한 결측치 찾고, 샘플 찾고, 그런 것들은 하겠는데 이거를 모델링 하는 거에서부터 사실 멘붕입니다. 작업형1 모의문제를 풀 때도 똑같이 강의를 듣던것보다 더 어려워서 멘붕이 왔었습니다. 일단은 모르겠는 부분은 인지한 상태로 다시 반복하겠다는 의지로 계속 강의를 듣는 게 맞겠죠? 반복이 답이겠죠??
선생님, 강의 열심히 보고 있는데 제가 5월 중순부터 시작하면서 조금 일찍 시작했는데도 불구하고 암기 할 게 너~~~~~~무 많아서 큰일입니다 ㅠㅠ 단권화 시키려고 실기용 교재를 샀는데 정말 정말 이것만큼은 꼭! 외우고 가야하는 코드나 문법같은거를 정리해주실 수 있나요? (강의나...파일로) 사실 고득점 합격은 바라지도 않고 60점 턱걸이로라도 너무 붙고싶습니다!
Django + Next로 프로젝트를 하나 구성해보려 합니다. Django 관련해서 몇 가지 질문이 있습니다. 1. django-admin으로 프로젝트를 생성할 때 DRF 초기 세팅이 완료되있는 상태로 프로젝트를 생성할 수 있나요? 2. Nextauth or Supabase + Next app router + Prisma ORM을 사용해서 웹 개발을 해본 경험이 있습니다. Next의 Server Action을 사용하여 only Typescript로 모의개발을 진행하였었는데 여기서 Next, Supabase가 아닌 Django를 백엔드 서버로 둔다면 얻을 수 있는 큰 강점은 뭐가 있는지 궁금합니다. 3. 데이터베이스 캐싱, 폴링 기능은 Supabase나 Prisma accelerate를 사용해서 처리했었습니다. django에 서도 해당 기능을 지원하나요? 4. django 혹은 python으로 Dapp을 개발할 수 있나요? 또 적합한 편인가요? 가능하면 새로운 언어와 플랫폼 보다는 익숙한 언어로 해보고 싶습니다. 아래 부터는 질문과는 딱히 큰 관계없는 얘기이기 때문에 답변해주시지 않아도 괜찮습니다! 단지 진로에 고민이 있기에 한번 적어봤습니다. 코테 > CS > 포트폴리오 & 프로젝트 순으로 공부 및 준비 중입니다. 현재 채용한파인 시기에다 java 공화국으로 불릴 만큼 spring 수요가 있기에 spring 배우는 게 취업적인 목적엔 좋겠지만 저는 java, spring은 영 안 끌리더라고요. 코딩 테스트 문제도 프로그래머스 레벨 3까지 전부 파이썬으로만 풀어왔었고 플젝은 Next로 진행했던 터라 가능하면 익숙한 python, typescript를 활용한 django, node 쪽으로 작업을 해보려고 합니다. 작업을 해봤을 때 저는 프론트엔드 적인 일보다는 백엔드쪽에 더 흥미를 느꼈습니다. 서버, 클라이언트 두 분야에 대해서 배웠지만 아무래도 신입 풀스택 개발자로는 역량이 부족하기 때문도 있고 러닝커브적인 문제 그리고 지식에 대한 유지를 위해서는 한쪽으로 가는 게 바르다고 판단했고 여기서 고민이 생깁니다. Node쪽으로 간다면 Next, Remix, Nest, Express 등을 사용할 수 있는데 개인적으로 Express는 레거시라 생각해서 딱히 손이 가진 않았습니다. Remix의 경우는 수요가 굉장히 적었고 비슷한 기능을 하는 Next가 있기에 선택지에서는 밀렸습니다. Nest는 서버 프레임워크 이지만 결국 React의 기능을 대체할 수 없으니 Node 쪽으로 간다면 차라리 둘 다 작업하는데 적합한 Next를 배우는 게 바르다고 생각했었는데 막상 Next는 프론트엔드 개발자만 뽑더라고요. 결국은 django를 배우는 게 가장 낫다고 판단했습니다. 다만 현재 Next에 대한 지식이 있는 편이고 익숙한데 반면 django에 대한 지식은 부족합니다. django + next 둘 다 사용해 프로젝트를 진행 한다면 백엔드 개발자든 프론트엔드 개발자든 취업하는데 도움이 될테지만 그만큼 긴 러닝 커브가 소요될 테고 너무 욕심이 크진 않은가 싶어서 고민이 되느라 갈피를 못잡고 있습니다. 어떻게 해야될지... htmx를 다루시던데 해당 기술로 작업한다면 무게감이 줄어드는것에서 좀 더 나아질까요? 짧은 조언이라도 주신다면 감사하겠습니다.
안녕하세요 선생님 빅데이터 분석에 관심이 있어 파이썬을 1도 모르는 상태에서 시작해 현재 선생님의 강의를 통해 많은 도움을 받고 있습니다. 현재 텍스트 마이닝 분석 방법으로 쓴 논문들을 보면 쇼핑몰 댓글 부터 해서 각종 SNS(페이스북, 인스타그램 등)의 댓글을 분석한 논문들을 많이 살펴볼 수 있는데 현재 파이썬 초보로서 데이터를 수집하는 과정(웹크롤링)이 제일 중요하고도 어려운 것 같습니다. 현재 텍스톰이나 빅카인즈 같은 웹사이트를 이용하는 것 말고 파이썬 으로 다양한 데이터를 직접 웹크롤링 해서 데이터를 수집하는 방법을 집중적으로 다룬 강의는 거의 찾아보기 어렵더라구요..ㅠㅠ 블로그 등에 검색해보면 코드가 공개된 것도 있지만 여기저기 코드 방식이 다 다양하고 막상 적용해서 실행해보면 또 에러 생기고 이유는 모르겠고 답답하더라구요. SNS 채널 및 쇼핑몰 댓글 등을 웹크롤링 하는 과정을 하나하나 다 보여주는 강의가 있으면 좋겠다고 생각하고 있는데 혹시 이렇게 여러 채널의 웹크롤링 과정만 다룬 강의를 올려주실 계획은 없으신지요?
안녕하세요 교수님. 강의 정말 잘 듣고있습니다. 현재 파머완 강의 8장 중간까지 들은 학생입니다. 저는 원래 교수님의 컴퓨터비전 로드맵을 따라갈 생각이었으나, 아직 머신러닝에 대한 기초가 부족하다고 느껴서(어느정도는 알았지만 개념적으로 부족했습니다) 이 강의와 책을 본 후 로드맵을 본격적으로 따라가려고 했습니다. 처음 강의인 CNN 강의에서 선수지식이 '기본적인 머신러닝에 대한 개념 이해' 정도로 작성되어있는데 꼭 나머지 8,9장까지 마무리하고 넘어가야할까요? 아 그리고 로드맵 강의를 수강하면서 앱(?)같은 것도 만들어볼 기회가 있을까요? 감사합니다!