의사 결정 트리 클래스 DecisionTreeClassifier 객체를 생성할 때 코드가 dt_clf = Decision_TreeClassfier(random_state=11) 이렇게 되던데요, random_state 값이 왜 파라미터로 필요한지 궁금해요. 이 객체는 이후에 학습 데이터 와 테스트 데이터를 받아서 학습과 예측을 수행하잖아요?? 이 과정에서 학습 데이터와 테스트 데이터가 어떻게 분리되었는지는 알 필요가 없는데 이 값이 왜 들어가나요???
안녕하세요. 책도보고 동영상도 보고 있는데 너무 궁금해서 이렇게 강의와 직접적인 관련이 없는데도 불구하고 이런 경우는 어떻게 접근해야할지 몰라서 문의드려봅니다. 문장의 예) Gildong weighs 60kg. Cheolsu weighs 70kg. Younghee weighs 49kg. 위 문장 텍스트에서 영희라는 사람의 몸무게를 구하고 싶습니다. 기존 개발방법이라면 문장으로 배열화 시켜서 for문 돌리면서 if문 사용하여 Younghee, weighs 단어가 포함된 문장배열에서 kg이 포함된 단어 또는 정규식으로 사용하든지해서 구할것입니다. 그러나 이렇게 나온 데이터가 AI영역에서는 의미가 없어 보입니다. 비정형화된 텍스트에서 특정 원하는 값을 구하고싶은데 AI 머신러닝 딥러닝의 개념으로 처리를 한다면 어떻게 접근해야할지 너무 감이 안옵니다. 정말 그냥 for문, if문 사용해서 영희의 몸무게를 뽑아내야하는건지 AI 개념에서는 어떻게 접근해야할지 작은 조언이라도 부탁드립니다.
안녕하세요 강의 잘듣고 있습니다. 머신러닝에 대한 개념이 많이 부족한지라 생각보다 시간이 걸리네요. 공부방법에 관한 질문드립니다. 혹시 코드를 하나하나 다 따라해보며 한줄한줄 다 이해하는게 나을까요 (현재 이런 방식으로 하고있습니다) 아니면 코드의 흐름 및 알고리즘 개념만 이해했으면 넘어가는게 나을까요?
리턴 값이 있는 함수를 멀티 프로세스로 실행할 때 실행된 함수의 리턴 값을 변수로 저장하여 사용할 수 있는 방법이 궁금합니다. from multiprocessing import Process def func1(): a = a+3 return a def func2(): b = b+2 return b def func3(): c = c+1 return c p1 = Process(target=func1) p2 = Process(target=func2) p3 = Process(target=func3) p1.start() p2.start() p3.start() p1.join() p2.join() p3.join()
질문은 아닙니다. 제가 몇 달 전에 강의를 보면서 저도 같은 증상을 겪었었는데 강의를 다시 와보니 다른 분들도 똑같은 상황을 겪는거 같아서 제가 해결한 방법을 알려드릴테니 한 번 해보시기 바랍니다. 윈도우 시작 버튼을 누르고 PowerShell 이라고 치면 PowerShell 관련 버튼이 생깁니다. 관리자권한으로 실행하시고 나서 Set-ExecutionPolicy Unrestricted를 입력하시고(대소문자 무관) Y를 입력하시고 엔터를 누르시면 됩니다. 그리고나서 다시 VSC로 돌아와서 venv\Scripts\activate.ps1 하시면 됩니다. 저는 일단 이 방법으로 해결이 됐습니다만 이렇게 해도 안될 경우는 저도 잘 모르겠습니다. 도움이 되셨길 바랍니다.
grid 에서 나온 최적의 하이퍼 파라미터 값이 직접 y_test 히여 정확도를 추출하였을때의 성능 모델 순위에서 낮으면 어떻게 하나요 ? 예를들어서 max_depth = 8로 최적 파라미터값이 출력이 되었는데 y_test 를 가지고 돌렸을시 max_dept =12 인 정확도가 가장 높을때 어떻게 하나요 ?
강의 약 9분 44초즈음에 보면 변환된 분류 결정 임곗값 배열의 Shape는 147이고 나머지는 148의 값을 갖습니다. 저의 경우, sklearn 0.23.1 버전으로 돌리고 있으며, 임곗값= 143, 나머진 각각 144로 1개씩 더 많습니다. 보면 (버전의 다름과 상관없이) 임계값의 배열수보다 1씩 더 많은 결과가 발생하는데요, 임계값이 정밀도, 재현율에 비하여 1개씩 부족한 이유에 대하여 알 수 있을까요?
[리뉴얼] 처음하는 파이썬 데이터 분석 (쉽게! 전처리, pandas, 시각화 전과정 익히기) [데이터분석/과학 Part1]
안녕하세요. 강사님. json_file_format.ipynb 파일에 있는 'json.dumps() 함수로 파이썬 사전 데이터를 JSON 문자열 데이터로 변환할 수 있음' 항목에서 질문이 있습니다. 아래 Input 코드에서 "language" 키의 값에 "Java" : "basic"이 들어있는 것을 알 수 있는데, json.dumps(data)로 json파일로 불러오면 Output에 해당 내용이 존재하지 않는 걸로 나옵니다. 이 부분이 이해가 잘 가지 않아서 질문드립니다. -Input import json # 변수에 문자열로 된 JSON 포멧의 데이터가 있을 경우 data = { "id":"01", "language": {"Java":"basic", "Java":"advance"}, "edition": "third", "author": "Herbert Schildt" } jsondata = json.dumps(data) jsondata -Output '{"id": "01", "language": {"Java": "advance"}, "edition": "third", "author": "Herbert Schildt"}'
[리뉴얼] 파이썬입문과 크롤링기초 부트캠프 [파이썬, 웹, 데이터 이해 기본까지] (업데이트)
안녕하십니까 선생님. 강의에서 다뤄주신 크롤링 기법을 사용해 제 개인 프로젝트에 활용하려고 하는 통계학과 대학원생입니다. 강의 외적인 질문이라 죄송스러운 마음이 앞서지만, 선생님같은 식견을 가지신 분이시라면 답을 알고 계실 것 같아 양해를 부탁드리며 질문 올리겠습니다. 보다 구체적으로, Daum뉴스에서 크롤링한 기사들의 원문을 데이터로 사용하는 모델을 만들어 이를 적용하고 그 결과를 제 깃헙 페이지에 공개하려고 했습니다. 하지만 프로젝트를 진행하는 과정에서 robots.txt의 존재를 알게 되었고, 실제로 news.daum.net/robots.txt를 확인해 봤을 때 해당 사이트에서 모든 크롤링 시도를 금지하고 있음을 확인할 수 있었습니다(User-agent: * Disallow : /). 저는 악의나 영리 목적의 의도가 없고, 심지어는 request와 request 사이에 지연을 줘서 서버에 무리가 가지 않도록 할 의향도 있습니다. 그럼에도 불구하고 robots.txt에 저렇게 지정되어 있으면 어떤 방식으로든 크롤링을 금지하며 이를 어길 시 어떤 방식으로든 책임을 물을 수 있다는 의미인지 궁금합니다. 마지막으로, 좋은 강의 항상 너무 감사하다는 말씀 드리고 싶습니다. 파이썬 기초는 이미 알고 있어서 사실 크롤링 부분만을 위해 강의를 수강하긴 했습니다만, 모든 내용을 잘 이해할 수 있었습니다. 이에 더해 파이썬 중급 강의도 거의 마쳐가는데, decorator나 generator의 원리를 확실히 알게된 것 같아 너무 유익하고 좋았습니다. 둘 다 곧 마무리하고 수강평 남기도록 하겠습니다! 이상입니다. 감사합니다.