학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 이렇게 풀어도 될까요? # 1) test데이터에서 design값 계산 pred = model.predict(test) # 2) test데이터에 대한 RMSE 계산 from sklearn.metrics import mean_squared_error RMSE = mean_squared_error(test['design'], pred) ** 0.5 print(round(RMSE, 3))
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 pvalue 가 유의수준 0.05보다 작으면 귀무가설을 기각하고 대립가설을 채택하는데 이 경우가 pvalue 가 유의하다라고 이해하면 되는건가요? 대부분의 케이스에서?
target = train.pop('총가스사용량') #원핫인코딩 # train = pd.get_dummies(train) # test = pd.get_dummies(test) #라벨인코더 from sklearn.preprocessing import LabelEncoder cols = train.select_dtypes(include = 'object').columns for col in cols: le = LabelEncoder() train[col] = le.fit_transform(train[col]) test[col] = le.transform(test[col]) #데이터 분리 from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size = 0.2, random_state = 0) # 랜덤포레스트 from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state = 0) rf.fit(X_tr,y_tr) pred = rf.predict(X_val) #라이트gbm # import lightgbm as lgb # lg = lgb.LGBMRegressor(random_state=0, verbose=-1) # lg.fit(X_tr,y_tr) # pred = lg.predict(X_val) #평가지표(RMSE) from sklearn.metrics import root_mean_squared_error rmse = root_mean_squared_error(y_val, pred) rmse #라벨인코더 - 랜덤포레스트 > 959.3866443164056 #원핫인코딩 - 랜덤포레스트 > 960.485846380754 #원핫인코딩 - 라이트지비엠 > 1064.8095758723994 #라벨인코더 - 라이트지비엠 > 1069.1629932934077 pred_final = rf.predict(test) submit = pd.DataFrame({'pred':pred_final}) submit.to_csv('result.csv',index=False) pd.read_csv('result.csv') 10회 유형2번을 풀어봤는데 라벨인코더와 원핫인코딩 두 가지, LightGBM과 랜덤포레스트 두 가지 이렇게 써서 4가지 경우의 수로 rmse가 가장 낮은 모델을 사용했습니다. 이 정도의 과정만 거쳐서 가장 좋은 모델을 적용해서 제출해도 높은 점수를 받을 수 있을까요? 기출 대부분이 전처리(결측치삭제, 대체 등)과정이 필요없던데 이번에 다가오는 시험에서도 전처리 할것이 없다고 판단되면 굳이 안건드려도 되는건가요?
안녕하세요 생각보다 할게 많아 복잡해서 몇가지 여쭤보고자 합니다!! 일원 분산 분석을 진행 할때 가장 먼저 정규성 검정을 해서 A,B,C,D라는 그룹이 있다는 가정하에 하나라도 0.05를 넘지 못하면 크루스칼 비모수 검정만 진행하고 끝내면 될까요? 이원 분산 분석은 정규성 검정, 등분산 검정은 너무 어려워보여서 학습을 안할까하는데 여태껏 출제된적이 있을까요? 일원 분산 분석과 이원분산분석의 사후검정 또한 학습을 하는 편이 좋을까요? (양이 너무 많아서 뺄수있으면 빼고싶은 마음에 여쭤봅니다) 일원분산 분석에서 만약 등분산검정을 했는데 피밸류가 0.05를 못넘었다면 equal_var=False 이값을 어디에 넣어주어야하나요? 감사합니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 작업형 2번 제출 시 result.to_csv("result.csv", index = False) 까지만 적어서 제출하면 되나요? 아니면 pd.read_csv("result.csv") 까지 작성해서 제출해야 하나요?
안녕하세요 좋은 강의 잘 들었습니다~! 강의를 모두 듣고 제공해주신 프로젝트를 쭉 확인하고 궁금한 점이 생겨서 문의를 남겨봅니다 저는 실무에서 도메인 모델과 엔티티 모델을 구분하지 않고 도메인 모델에 JPA관련 어노테이션을 모두 허용한 상태로 개발해왔습니다 물론 구분해서 개발해본적도 있었지만 컬럼 변경 등 다양한 변경사항에 대응할 때마다 도메인 모델과 엔티티모델을 둘 다 확인하고 변경해야하는 번거러움?이 생겼던거 같아서 클래스가 좀 지저분해지더라도 도메인 모델 하나로 개발하고 테스트 코드를 작성해왔었습니다 이번 강의에서 사용된 프로젝트의 경우 모듈과 패키지가 나눠져있어서 도메인 모델과 엔티티 모델이 분리되어있는듯 보이지만 제가 사용했던 구조와는 다른점이 있었습니다..! 도메인 모델은 강의에서 말씀하신 개념 과 격벽 그리고 행동에 대해 적절하게 표현하기위한 객체이지만 핵심 비즈니스 로직을 모두 포함하고 있는게 아니라 대부분 조회된 데이터를 개념에 맞게 변경하는 DTO? 역할을 하는것 같고 상태변경에 대한 로직은 엔티티에 구현하고 service 레이어에서 호출하는 방식으로 보여집니다 그렇지만 처음 보는 코드가 잘 읽힐정도로 충분히 설득력있는 구조라고 생각이 듭니다.. 다만 테스트 코드가 있어야만 그 설득력이 완벽해질것 같다는 생각이 들었습니다 그래서 해당 프로젝트 구조를 더 이해하고 학습하기위해 테스트 코드를 작성해보려고 합니다 만약 저라면 ~Entity에 작성되어있는 상태변경에 대한 테스트 코드와 ~Service, ~Handler, ~Manager 등에 작성된 로직에 대한 테스크 코드를 작성할 것 같은데 강사님은 이러한 구조에서 테스트 코드를 어디까지 작성하시는지 또는 어떻게 접근하시는지 궁금합니다~!
안녕하세요. 다음주 빅데이터실기 준비중인 직장인입니다. (5*대) [현재상태] 온라인강의는 1~114번까지 1회 정독 및 가능한 같이 코딩해봄( 모르는것이 있으면 풀이과정을 보며 방향성을 잡고 풀어봄, 60~70%정도는 풀이과정의 도움을 받음 ) 작업형2~3형은 대충 시험의 방향성을 잡히는것 같고, 작업형1형은 더 많이 풀어 보는수 밖에 없는것 같음 [오늘 이후 공부의 방향성에 대한 질의] 오늘 이후 8~8일 정도 어떤 계획을 가지고 공부를 진행해야 하는지요? 시험시간 3시간에 대한 감이 없는데, 어떻게 풀어야 하는지는 생각이 나는데 함수 및 명령어 등이 생각이 않나는 경우 dir 및 help 기능을 참조하면 풀수 있는 시간인지요 3시간이? 꼭 암기해야하는 부분은 무엇인지요? 5*대이니 해도해도 자꾸만 단어등이 깜박깜박하네요.강사님의 좋은 조언 부탁드립니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 df['출동시간'] = pd.to_datetime(df['출동시간']) df['도착시간'] = pd.to_datetime(df['도착시간']) df.info() 이렇게 했어야했는데 실수로 df['출동시간'] = pd.to_datetime(df['출동시간']) df['도착'] = pd.to_datetime(df['도착시간']) df.info() 이라고해서 0 소방서 100 non-null object 1 출동시간 100 non-null datetime64[ns] 2 도착시간 100 non-null datetime64[ns] 3 도착 100 non-null datetime64[ns] 이라고 나옵니다 실수로 도착이라고 저장된거를 어떻게 취소하나요?
지금 기출 6회 작업형 1-1번 문제를 풀던 중 갑자기 의문이 생겼습니다. result = df.gruopby('소방서')['diff'].mean()에서 나온 결과물에서 바로 수치를 확인하고 답안을 제출해도 되는지?? 꼭 print(81)로 코드가 입력하여 결과물이 나온 상태로 확인하고 답안을 제출 해야하나요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 저는 파이썬 왕초보인점 먼저 밝힙니다 ㅜ df.loc[2000].mean() 을 실행했을 때 왜 저는 선생님처럼 안나오고 np.float64(100.735) 이렇게 나올까요? 똑같은 코드를 썻는데요 ㅠ