https://dataq.goorm.io/exam/116674/체험하기/quiz/4 여기서 하는 성별예측 문제에서 import pandas as pd train = pd.read _csv("data/customer_train.csv") test = pd.read _csv("data/customer_test.csv") # print(train.shape, test.shape) # print( train.info ()) # print(train.isnull().sum()) # print(test.isnull().sum()) #결측치 처리 (환불금액) train['환불금액'] = train['환불금액'].fillna(0) test['환불금액'] = test['환불금액'].fillna(0) # print(test.isnull().sum()) # print(train['성별'].value_counts()) #인코딩 target = train.pop('성별') train = pd.get_dummies(train) test = pd.get_dummies(test) #검증 데이터 분리 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) # print(X_tr.shape, X_val.shape, y_tr.shape, y_val.shape) from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=0) rf.fit (X_tr, y_tr) pred = rf.predict_proba(X_val) # print(pred) from sklearn.metrics import roc_auc_score roc = roc_auc_score(y_val, pred[:,1]) #예측 및 파일생성 pred = rf.predict_proba(test) submit = pd.DataFrame({ "pred":pred[:,1] }) submit.to _csv("result.csv", index=False) # print( pd.read _csv("result.csv")) 이렇게 코딩을 했는데 예측 및 파일 생성에서 pred = rf.predict_proba(test) 여기 부분이 오류가 뜨는데 왜 그런가요 ㅠㅠ > Makefile:6: recipe for target 'py3_run' failed make: *** [py3_run] Error 1 Traceback (most recent call last): File "/goorm/Main.out", line 43, in <module> pred = rf.predict_proba(test) File "/usr/local/lib/python3.9/dist-packages/sklearn/ensemble/_forest.py", line 674, in predict_proba X = self._validate_X_predict(X) File "/usr/local/lib/python3.9/dist-packages/sklearn/ensemble/_forest.py", line 422, in validate X_predict return self.estimators_[0]._validate_X_predict(X, check_input=True) File "/usr/local/lib/python3.9/dist-packages/sklearn/tree/_classes.py", line 407, in validate X_predict X = self._validate_data(X, dtype=DTYPE, accept_sparse="csr", File "/usr/local/lib/python3.9/dist-packages/sklearn/base.py", line 437, in validate data self._check_n_features(X, reset=reset) File "/usr/local/lib/python3.9/dist-packages/sklearn/base.py", line 365, in check n_features raise ValueError( ValueError: X has 73 features, but DecisionTreeClassifier is expecting 74 features as input. 이렇게 뜹니다,,
안녕하세요. 좋은 강의 감사드립니다. 덕분에 잘 배우고 있습니다. 문제 2. 주어진 데이터에서 결측치가 30%이상 되는 컬럼을 찾고 해당 컬럼에 결측치가 있는 데이터(행)를 삭제 함. 그리고 30% 미만, 20% 이상인 결측치가 있는 컬럼은 최빈값으로 값을 대체하고 'f3'컬럼의 'gold' 값을 가진 데이터 수를 출력하세요! 문제2를 대하고 순간 다음과 같은 고민을 했었습니다. 1번을 수행하여 'f1'컬럼의 결측치 행을 삭제한 후 2번을 하려니 'f3'컬럼의 결측치 갯수가 18개만 남더군요. 그럼 18개는 최초 데이터 100개의 20% 미만일까? 그렇지 않다. 'f1'컬럼 결측치를 제거한 후 데이터 갯수 69개의 20%~30%(14~20)에 해당한다. 그렇다면 'f3'컬럼의 최빈 값은 'f1'컬럼의 결측치를 제거하기 전의 값을 사용해야할까 아니면 결측치 제거 후의 값을 사용해야 할까? 결과적으로는 어떤 방식으로 하던 답은 56으로 일치했지만 주어진 데이터에 따라 다른 값이 나올 수도 있을 것 같습니다. 혼돈을 없애기 위해 문제 2의 문항 순서를 바꾸면 어떨까요? 30% 미만, 20% 이상인 결측치가 있는 컬럼은 최빈값으로 값을 대체하고 주어진 데이터에서 결측치가 30%이상 되는 컬럼을 찾고 해당 컬럼에 결측치가 있는 데이터(행)를 삭제 함. 'f3'컬럼의 'gold' 값을 가진 데이터 수를 출력하세요!
선생님,좋은 강의 제공해주셔서 감사의 말씀드리고 싶습니다!!! 다름이 아니라 몇가지 질문사항이 있어서 글을 남깁니다. 저는 현재 군필이며 it를 얕게 배우는 학과에 2학년으로 재학중이고 진로는 정해지지 않은상태이며 알고리즘(파이썬),리액트를 공부중에 있습니다. 자신이 배운 내용을 가르친다는 느낌으로 블로그를 쓰면 좋다고 하셨는데 어떤 플랫폼(티스토리 등) 을 쓰면 좋을지 궁금합니다 한국 백엔드 취업시장은 자바(스프링)이 독보적이라고 알고 있습니다. 취업시장에서는 프론트와 백을 나누어 뽑으며 이를 고려하여 자바를 할줄 몰라도 백엔드를 자바로 입문하는게 좋다고 생각하였는데 일각에서 자바는 어려우니 자바스크립트 기반의 node.js로 입문하라는 이야기를 들었습니다. 장고, nodejs,nextjs,sprng 등 무엇으로 입문하면 좋을지 선생님의 개인적인 의견이 궁금합니다!!! 또한 방학동안 프로젝트 외에 공부하면 좋을 cs지식(시스템프로그래밍,운영체제 등)은 무엇인지 궁금합니다!! 긴글 끝까지 읽어주셔서 감사합니다!!!
안녕하세요 강사님 올해 말 실기 시험 목표로 강의를 수강 중인 학생입니다. 강의 수강 중 문득 걱정이 되는게 있어서 문의 드립니다. 맥북 단축키 같은것도 알려주시고 당장 수강하는데는 별 문제없다고 생각하는데, 시험장에 맥북을 들고 갈 순 없는 노릇이니.. 혹시 맥북으로 공부해 갔을때 발생할 수 있는 문제와 그에 대처방법이 혹시 있을까요?
안녕하세요 비전공자 직장인입니다. 퇴근후 딴짓 님 강의를 열심히 듣고 있습니다. 현재 작업형2 모의문제 2를 혼자서 풀고 있는데, 단순한 결측치 찾고, 샘플 찾고, 그런 것들은 하겠는데 이거를 모델링 하는 거에서부터 사실 멘붕입니다. 작업형1 모의문제를 풀 때도 똑같이 강의를 듣던것보다 더 어려워서 멘붕이 왔었습니다. 일단은 모르겠는 부분은 인지한 상태로 다시 반복하겠다는 의지로 계속 강의를 듣는 게 맞겠죠? 반복이 답이겠죠??
선생님, 강의 열심히 보고 있는데 제가 5월 중순부터 시작하면서 조금 일찍 시작했는데도 불구하고 암기 할 게 너~~~~~~무 많아서 큰일입니다 ㅠㅠ 단권화 시키려고 실기용 교재를 샀는데 정말 정말 이것만큼은 꼭! 외우고 가야하는 코드나 문법같은거를 정리해주실 수 있나요? (강의나...파일로) 사실 고득점 합격은 바라지도 않고 60점 턱걸이로라도 너무 붙고싶습니다!
선생님 프로젝트 폴더 및 파일 이름을 어떤식으로 주로 지으시나요? 강의에서처럼 01-02-token-api 이런식으로 주로 하시나요? 아니면 01-02-tokenApi 이런식으로 하시나요?? 프로젝트 폴더 및 파일 이름은 같이 작업하는 개발자들끼리 코드컨벤션을 짜서 정하는거라고 하지만,, 아직 취준생이고 혼자 작업하는 일이 많은 저는 어떤방식으로 해야할지 고민입니다. 어떤 방식을 더 선호하시고 추천하시나요? (프론트 백엔드 구분없이 !)
저장 시 Prettier를 통한 자동 formatting이 적용되지 않아서 찾아보니 아래 링크와 같이 default formatter를 수정하니까 정상 동작되었습니다. 참고하시면 좋을 것 같습니다. ^^ 감사합니다. https://medium.com/@su_bak/vscode%EC%97%90%EC%84%9C-prettier%EC%9D%98-format-on-save%EA%B0%80-%EB%8F%99%EC%9E%91%ED%95%98%EC%A7%80-%EC%95%8A%EC%9D%84-%EB%95%8C-%ED%95%B4%EA%B2%B0%EB%B2%95-7556ef28e01a
안녕하세요 교수님. 강의 정말 잘 듣고있습니다. 현재 파머완 강의 8장 중간까지 들은 학생입니다. 저는 원래 교수님의 컴퓨터비전 로드맵을 따라갈 생각이었으나, 아직 머신러닝에 대한 기초가 부족하다고 느껴서(어느정도는 알았지만 개념적으로 부족했습니다) 이 강의와 책을 본 후 로드맵을 본격적으로 따라가려고 했습니다. 처음 강의인 CNN 강의에서 선수지식이 '기본적인 머신러닝에 대한 개념 이해' 정도로 작성되어있는데 꼭 나머지 8,9장까지 마무리하고 넘어가야할까요? 아 그리고 로드맵 강의를 수강하면서 앱(?)같은 것도 만들어볼 기회가 있을까요? 감사합니다!
안녕하세요! 교수님 강의를 듣고 있는 수강생입니다 ! 강의를 복습할 때 개인 블로그에 수업 내용을 정리하면서 게시를 하고 싶은데요 ! 강의 내용에 포함되어있는 이미지를 사용해서 간단하게 요약해서 게시를 하고 싶은데 저작권법에 걸리는 지 여쭤보고 싶어서 글을 작성합니다 ! 개인 블로그에 강의 자료(이미지 등)을 사용해서 복습 용도로 게시를 해도 될까요 ??