학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요. 피쳐 엔지니어링 원핫인코딩 결과 display 해보면 저는 왜 0, 1 값이 아닌 True, False로 나올까요.. ? 아래 코드입니다. display(c_train.head())는 정상적으로 출력됩니다. # 원핫 인코딩 n_train, n_test, c_train, c_test = get_nc_data() # 데이터 새로 불러오기 display(c_train.head()) c_train = pd.get_dummies(c_train[col]) c_test = pd.get_dummies(c_test[col]) display(c_train.head())
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 예측값을 구하려고 데이터프레임을 만들고 있었습니다! 숫자라 단순히 숫자만 쓰고 넘어가려고 했는데, 위 사진처럼 오류가 나요... 이건 왜그러는 걸까요 ? 작업형2에서는 문제없이 되었던것 같은데요ㅠㅜ
안녕하세요. 섹션 6 단일 표본 검정에서 데이터가 정규성을 띄지 않을때 비모수검정을 진행하셨는데요. 윌콕슨 부호 순위 검정은 평균에 대한 검정이 아니라 중앙값에 대한 검정으로 알고 있습니다. 그런데 stats.wilcoxon(df['무게']-120, alternative='less') 라고 평균값 120을 무게에서 빼서 진행되었는데 120대신 중앙값을 넣어야 되는것 아닌가해서 질문드립니다. 문제 상황에서는 중앙값을 알려주지 않았기 때문에 평균값을 쓴것인지 아니면 윌콕슨 부호 순위 검정에서 평균값을 써도 되는 근거가 있는 것인지 궁금합니다.
안녕하세요. 좋은 강의 재밌게 수강하고 있습니다. Spark Structured Streaming Fault Tolerance 강의에서 아래와 같이 gracefully 하게 스트리밍을 종료할 수 있다고 말씀 주신 부분에서 질문이 있습니다. .config("spark.streaming.stopGracefullyOnShutdown", "true") 현재 업무에서 Spark Streaming을 사용했을 때 아래 코드와 같이 파라미터에 명확하게 stopGracefully 이 존재하여서 이를 이용하여 스트리밍을 안전하게 종료했습니다. def stop(stopSparkContext: Boolean, stopGracefully: Boolean): Unit 하지만, Spark Strucutred Streaming으로 전환했을 때 이러한 파라미터가 존재하지 않아서, 아래 링크를 참고하여 직접 구현하였습니다. https://stackoverflow.com/questions/45717433/stop-structured-streaming-query-gracefully 강의에서 알려주신 것처럼 아래와 같이 사용하면 동일하게 Structured Streaming도 Gracefully하게 종료할 수 있다고 이해하면 될까요? .config("spark.streaming.stopGracefullyOnShutdown", "true") Gracefully 스트리밍을 종료 한다라는 의미가 현재 처리 중인 마이크로 배치까지는 모두 다 처리 및 체크포인트 작성까지 한 후 스트리밍 종료로 이해하면 될까요? 마지막으로, DR 같이 스트리밍 종료가 아닌 클러스터가 모두 비정상적으로 종료되었을 경우 Gracefully 옵션이 적용되지 않는 케이스를 경험 했는데, 이런한 케이스는 현업에서 주로 어떻게 대처하고 있을까요? (예를 들어 체크 포인트 등이 불일치하게 스트리밍이 종료) 감사합니다.
안녕하십니까. 작업형 2번 원핫 인코딩 부분을 수강하다가 궁금한 점이 생겨 질문 남깁니다. 원핫 인코딩을 한 결과, 값이 0또는 1로 나오는 것이 아닌, True False로 결과값이 출력이 됩니다. 강의 3-6 Regression 파트에서 cols = ['sex','smoker','region'] train = pd.get_dummies(train,columns = cols) test = pd.get_dummies(test, columns = cols) display(train.head(2)) display(test.head(2)) 위의 코드를 실행하면 범주형 변수들의 원핫 인코딩 결과가 False, True로 밖에 나오지 않습니다. 혹시 이렇게 두어도 머신러닝을 수행하는데 문제가 없는 것인지, 아니면 반드시 0과1로 바꾸는 작업이 필요한 지 궁금합니다. 만약 0과 1로 무조건 바꿔야한다면, 코드에서 어떠한 실수를 했는지 의문이 들어 질문 남깁니다. 감사합니다.
안녕하세요! 문제 1번 관련해서 질문이 있습니다. 3번째 질문에 <앞에서부터 70% 데이터를 구하는> 코드를 df = df.head(int(len(df)*0.7)) 위와 같이 head 를 사용해서 풀었는데요. 슬라이싱으로 df = df[:int(len(df) * 0.7)] 하는 것이 더 정확하게 푸는 방법인 걸까요? 아니면 같은 개념이니 둘 다 사용해도 괜찮은 걸까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 4회기출 작업형 1-3번 문제에서 아래쪽 풀이3번을 보고 있는데, 질문있습니다! df['date_added'].between('2018-01-01','2018-01-31') 이부분에서 between안의 인자들은 모두 포함인가요 ? 시작일 : 2018-01-01 종료일 : 2018-01-31 시작일 종료일 모두 포함 인건지 궁금합니다~! loc,iloc헷갈리듯이 이 함수는 어떤지 알려주세요ㅠ
3-1번을 강의와는 다르게 다음과 같이 작성해봤습니다.... 답이 다르게 나오던데.. 혹시 어떤 부분이 잘못되었는지 알려주실 수 있나여??? ※ x_train에는 gender 컬럼 제외시켰고, y_train은 gender컬럼만 입니다. import statsmodels.api as sm x_train = sm.add_constant(x_train) model = sm.Logit(y_train, x_train).fit() print(round(np.exp(model.params['weight']),4))
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 # 수치형 - 민맥스 스케일링 cols = ['age', 'fnlwgt', 'education.num', 'capital.gain', 'capital.loss', 'hours.per.week'] from sklearn.preprocessing import MinMaxScaler scaler = MinMaxScaler() n_train[cols] = scaler.fit_transform(n_train[cols]) n_test[cols] = scaler.transform(n_test[cols]) KeyError: "None of [Index(['age', 'fnlwgt', 'education.num', 'capital.gain', 'capital.loss',\n 'hours.per.week'],\n dtype='object')] are in the [columns]" 수치형 - 민맥스 스케일링 부분이에서 이러한 에러가 뜹니다..ㅜㅜ 해결 방법이 궁금합니다.
선생님! iloc같은경우 인덱스값은 그 앞에 까지 뽑기때문에 +1 해주는 범위까지 설정 해 주는것인데, 컬럼 번호 쓸때는 해당 없는거 같네요?! quiz 2번 푸는데 iloc로 메뉴~할인율 까지 할때 범위를 :3으로 하시길래요! 위에 설명할때는 iloc때 범위를 :로 나타낼 때 마지막을 포함하지 않는다고 하셨는데, 인덱스만 포함하지 않는게 맞는거죠?