csv 파일이 주어질때 train, test 2개 주어질때와 X_train , y_train, X_test 3개 주어질때 간단하게 생각하면 X_train,y_train 데이터로 나눠있는 데이터를 train으로 나누지 않고 주어졌다고 생각하면 될가요? 2개로 주어졌을때는 타겟값만 pop으로 빼내고 3개일때는 train값을 합쳐서 결측치, 전처리 하면 될가요
시험장에서 아래와 같이 풀이해도 괜찮을까요? loc를 사용하지 않고 df["DE14"]를 입력해서 구해도 괜찮은지 궁금합니다! # DE1~DE77컬럼 중 주가지수의 종가 "close"와 가장 상관관계가 높은 변수를 찾아 abs(df.corr()["close"]).sort_values(ascending = False) # 해당 변수의 평균값을 구하시오. (반올림하여 소수 넷째자리까지 계산) print(round(df["DE14"].mean(),4))
안녕하세요 강사님 강의 풀이 중 궁금한게 있어서 질문드립니다! 강의에서 object 타입의 대해서만 encoder 하고, int, float 타입에 대해서는 별도의 scaler 작업을 안하신 것 같은데 혹시 스케일링 작업은 필수가 아닌가요?? 성능만 잘 나오면 생략해도 무방한가요?
[리뉴얼] 파이썬입문과 크롤링기초 부트캠프 [파이썬, 웹, 데이터 이해 기본까지] (업데이트)
정규표현식 설명이 되어 있는 주피터 학습 자료 파일을 pdf 로 변환해서 저장하려 합니다. 변환은 어떻게 할 수 있나요?? - 본 강의 영상 학습 관련 문의에 대해 답변을 드립니다. (어떤 챕터 몇분 몇초를 꼭 기재부탁드립니다) - 이외의 문의등은 평생강의이므로 양해를 부탁드립니다 - 현업과 병행하는 관계로 주말/휴가 제외 최대한 3일내로 답변을 드리려 노력하고 있습니다 - 잠깐! 인프런 서비스 운영(다운로드 방법포함) 관련 문의는 1:1 문의하기를 이용해주세요.
glm 대신 logit을 사용해도 되나요? 아래와 같이 입력하면 model. summary 결과에 deviance 값이 없는데, 문제에서 로지스틱 회귀 모델을 적합시키라고 했는데 어떨때는 logit을 사용하고, 어떨때는 glm을 사용해야 하는지 모르겠습니다! from statsmodels.formula.api import logit model = logit("gender ~ age + length + diameter + height + weight", data = train).fit() model.summary()
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요~ 작업형2 모의문제2 : 에어비엔비 가격예측에서 2가지 질문드립니다. 작업형2 모의문제1에서는 CLIENTNUM로 인해서 과대적합 가능성이 있다고했는데 이번에는 id는 남겨놓고 host,name 등만 삭제하셨더라구요. 이번엔 ID를 남겨놓은 이유가 있을까요? R2 score 값이 1에 가까울수록 좋은 모델이라고 알고 있었습니다. 질문을 찾아보니 모델 점수에 연연하지 말라고 하셨는데, 그래도 R2 SCORE값이 -값이 나오거나 0.01 정도로 나오면 시험볼 때 많이 불안할 것 같더라구요.. - 값이나 0.01 정도로 나와도 괜찮은 건가요?
Chi2ContingencyResult(statistic=5.929494712103407, pvalue=0.01488951060599475, dof=1, expected_freq=array([[115., 115.], [185., 185.]])) 다음과 같이 결과가 나오는데, 여기서 expected_freq=array(남자의 합격 기대빈도(115), 남자의 불합격 기대빈도(115), 여자의 합격 기대빈도(185), 여자의 불합격 기대빈도(185)) 이 순서가 맞나요??
수업을 듣다보면 함수나 모델이나 이런것들을 가져올때 nump, sklearn, sklearn.preprocessing 등...그리고 import 해오는 것들이 어디에 속해있는 것인지? 이런 것들이 외우려니 좀 많이 혼동이 되서 잘 안외어져서 질문드립니다. 시험장에서 좀더 효율적으로 잘 기억나게 하는 방법이 있는지요? 아니면 나올때 마다 다 외워야하는지요?
안녕하세요 일코님. 저번에 visible설정을 잘 알려주셔서 무척 도움을 받았습니다! 다름이 아니고 원래는 제가 mac에서만 작업을 했는데요. 이번에 hwp 강의를 구매하면서 삼성 노트북을 구매하여 쓰고있습니다. 그런데 이 시스템 환경변수가 매번 말썽입니다. vscode + anaconda + bash터미널을 쓰고있는데요. bash 터미널에 which conda 명령어를 입력하면 $ which conda /c/Users/samsung-user/anaconda3/Scripts/conda 이렇게 잘 인식을 하고 있는데요. conda 명령어를 입력하면 $ conda bash: C:\Users\samsung-usernaconda3\Scripts: No such file or directory samsung-user/anaconda3 로 인식되어야 하는데, samsung-useraconda3 로 이렇게인식이 되고 있네요. GPT랑 아무리 씨름을 해보아도 답이 안나오더라구요. GPT가 시킨것은 ~/.bashrc 파일과 ~/.bash_profile 파일을 수정하라는 것인데, 각 파일은 아래와 같이 수정했습니다. ~/.bashrc ~/.bash_profile 시스템 환경 변수 설정도 아래와 같이 했는데요... 혹시 뭐가 문제가 있는걸까요?? 부탁드립니다 ㅠㅠㅠ 늘감사합니다!!
[리뉴얼] 파이썬입문과 크롤링기초 부트캠프 [파이썬, 웹, 데이터 이해 기본까지] (업데이트)
선생님 인프런에 있는 고급 크롤링 강의는 리뉴얼이 안되는 걸까요? ( 쉽게 처음하는 파이썬 고급 크롤링 [Scrapy, Selenium, Headless Chrome] ) 예전에 구매한 이 강의 들을 예정인데 강의 자체가 구매불가로 내려가고, 선생님이 자체 운영하는 사이트에서 새 강의가 올라온 걸로 보여서요. ㅠㅜ
ob = df.value_counts(normalize=True).sort_index() ob = ob.to _list() ex = [0.1, 0.05, 0.15, 0.7] 즉, 관찰값과 기댓값을 비율로 입력하여 관찰값 [0.2, 0.15, 0.1, 0.55] 기댓값 [0.1, 0.05, 0.15, 0.7] 으로 비교하면 안되나요? 비율은 같은데 통계량과 P-value 가 다르게 나오네요.