체험환경 작업형3의 3번 소문제에 ' 독립표본 t-검정을 수행하고 p-값을 구하여라 .' 라고 되어있으므로, a) ' stats.ttest_ind '를 사용하는 것을 이해하였고, b) 소문제 1~2번의 문제 흐름상 '등분산성을 가진다.'라고 가정되어 ' equal_var=True '(dafault 값이지만)를 입력하신 것도 이해하였습니다. 궁금한 점은, 제가 문제 풀이 후에, 궁금해서 아래와 같이 shapiro 정규성 검정 과 levene 등분산성 검정 을 해보았는데, shapiro 정규성 검정에서 정상 그룹 데이터가 정규성을 따르지 않는 결과가 나왔습니다. 그렇다면 원래는 비모수 검정(만위트니유) 를 해야한다고 생각되는데, 그냥 문제에서 요구한 대로 ttest_ind를 사용해서 푸는 게 맞는건지 헷갈립니다. [실행했던 코드] a = df.loc[df['Classification'] == 1]['log'] b = df.loc[df['Classification'] == 2]['log'] print(stats.shapiro(a)) print(stats.shapiro(b)) print(stats.levene(a,b)) print(stats.ttest_ind(a, b)) [출력 값] ShapiroResult(statistic=np.float64(0.9521376332731428), pvalue=np.float64( 0.03589547584091299 )) ShapiroResult(statistic=np.float64(0.9801637075675661), pvalue=np.float64(0.3916017054819772)) LeveneResult(statistic=np.float64(1.8175868256604175), pvalue=np.float64(0.18027345425360713)) TtestResult(statistic=np.float64(-3.0286077921788532), pvalue=np.float64(0.003039226943143319), df=np.float64(114.0))
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 저번 실기시험에서 낙방할때 R로 작업을 했는데요 1유형을 R로 하고 2,3유형을 python으로 한다거나 유형에 따라 교차로 시험 볼수 있나요? 갑자기 생각 안나면 그전에 외웠던거라도 해야 하나 싶어서 여쭙니다
for i in range(0, 5): list_box = [] for k in range(0, 200): ran_num = random.randint(1,200) list_box.append(ran_num) df[i+2000] = list_box df = df.T 제가 이해하기로는 2000 부터 2004까지 5개의 행을 만들고 각 행에 200개의 자료를 넣는데 1부터 199 까지의 정수를 넣는다. 그렇다면 df.T는 어떤 의미일까요? 그리고 randint 이 함수는 랜덤정수를 생성한다는 것일까요? 1부터 200 사이의 정수를 랜덤으로 넣는다는 의미가 맞을까요?
안녕하세요 강사님, 이전에도 같은 질문을 드린 적 있으나 아직 답변을 받지 못해서 다시 한 번 질문 드리는 점 양해 부탁드립니다. 제 강의 기한이 이번달 16일까지이지만.. 혹시나 가능하다면 올해 하반기 시험이 열리는 11월 29일까지 강의 기한을 연장할 수 있을지 문의드리고 싶습니다. 기간 연장이 안된다면..ㅠㅠ 1.5개월 치 수강료라도 결제하고 싶습니다..ㅠㅠ 메일 주소 남겨놓고 갑니다, 답변 해주시면 너무나도 감사하겠습니다!! dabin644@naver.com 감사합니다!
from google.colab import files upload = files.upload() 위 명령어 실행없이 바로 데이터 불러올수없나요? 퇴근후딴짓님처럼 바로 df=pd.read_csv("members.csv") 로 불러오고싶은데 에러가 나네요 No such file or directory:members.csv
1) 해당 부분에서 비교연산자가 이상/이하가 아니고 초과/미만을 사용하고 있는데 분위수값에 해당하는 값이 있으면 그 결과가 다를꺼 같아서요. 25% 데이터 구하세요 하는 문제는 정의자체가 분위수값 미만의 값 이런식으로 정해진건가요? 2) 하위 25% 데이터를 구하는 함수가 있다면, 상위 25%는 ~ 를 이용해서도 함수를 쓸 수 있을까요? 3) 가장 큰 값이 두개 이상인경우 더 앞선것을 불러오던데, 해결방법이 있을까요? (가장 큰 값이 동일한경우 모든 인덱스를 불러오게끔)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요? 담당자님. 해외 주재중인 수강생입니다. 11회 필기 붙고 바로 실기치려고 했는데 사정상 11회 실기 시험날 입국을 못할 것 같아 내년 상하반기에 다시 트라이해야할 것 같습니다 혹시 3개월만이라도 정지가 가능한지 여쭙습니다. 감사합니다. 주재원 증명할 수 있는 노동비자 혹은 출입국 확인서 제출 가능합니다.
문제2를 풀다가 보니, 초기 데이터프레임 상태에서 1. 주어진 데이터에서 결측치가 30%이상 되는 컬럼을 찾고 해당 컬럼에 결측치가 있는 데이터(행)을 삭제함. --> 1 번 문제를 처리하고나면, 전체적인 결측치 상태가 달라집니다. 2. 그리고 30% 미만, 20%이상인 결측치가 있는 컬럼은 최빈값으로 대체하고 1번 처리하고 난 후 2번 문제에 해당하는 조건의 컬럼은 없게 되는데, 이런 경우 1번 처리된 결과가 아닌 초기 데이터프레임 상태에 대해 문제를 풀어야 하는거죠? 선생님 풀이도 초기 상태를 고려하여 풀이된 것 같습니다. 시험에서도 이렇게 하면 되는거죠?
[색션3. 작업형1 판다스]의 Section9. 데이터 추가/변경에서 행을 추가할 때는 df .loc[...] 이용해서 하는데 Section5. 새로운 컬럼(열) 추가에서는 그냥 df ['new'] = .... 로 추가를 하더라구요. 이 둘의 차이가 있을까요? 제가 이해한 것은 열을 추가할 때는 df ['new'] = 또는 df.loc[ , 'new'] = 행을 추가할 때는 df.loc['new'] = 이렇게 쓸 수 있고 loc를 사용하면 각각의 데이터를 넣을 수 있지만, 사용하지 않는 경우(Section5)는 일괄적으로 같은 값이 들어간다..인데 맞는지 궁금합니다!