위 화면은 선생님이 풀이해주신거고 아래는 제가 작성한 코드입니다. # your code import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv") # print(df.isnull().sum()) # print(df.shape) df=df.dropna(subset=['views']) # print(df.shape) df['f3']=df['f3'].map({'silver':1,'gold':2,'vip':3}) df['f3']=df['f3'].fillna(0) int(sum(df['f3'])) 결측치 처리를 할때 선생님은 numpy 라이브러리를 통해 replace(np.nan,0) 을 사용했습니다. 저는 아래와 같이 실버,골드,vip를 맵핑해준 후, 결측치를 0으로 처리했습니다. df['f3']=df['f3'].map({'silver':1,'gold':2,'vip':3}) df['f3']=df['f3'].fillna(0) 질문1) 위와 같이 결측치 따로, 맵핑 따로 작성 해도 되나요? 총계합은 동일하게 나오면 상관없나요? 질문2) 위 코드에서 제가 처음에는 결측치를 먼저 처리하고 맵핑을 했더니, 맵핑한 이후에는 0으로 처리했던 결측치가 다시 NaN 이 되어서 작성 순서를 맵핑 후 결측치 처리로 변경했는데.. 왜 그런건가요? 순서에 따라 결과가 달랐습니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 관측값 - 예측값이 잔차인데 df['키] - model.predict(df['몸무게']) 인 이유가 어떤건가요?? 종속변수가 실제값이고 독립변수가 예측값이라고 생각하고 하면 되나요?
2-5.링크드 리스트 구현 - 2 02_04_add_node_linked_list.py 해당 내용에서 강의에서는 index 번째에 value 를 추가 하라고 되어있는데, 교재 해당 코드 스니펫의 return문 에는 return "index 번째 Node 뒤에 value 를 추가하세요!" 라고 기재되어있습니다 🙂 풀이 부분은 강의와 동일한데, 해당 부분 먼저 확인해서 문제를 풀면 기준이 조금 달라져서 풀이가 달라지게 되니 문구의 수정이 필요하지 않나 해서 질문 남깁니다!
작업형2 다중분류 문제에서 예측할 컬럼: 농약검출여부 (0:미검출, 1:검출, 2:재검사 필요) 일때, roc_auc_score는 적용할 수 없는지 문의드립니다. 예를 들면 이진분류에서는 pred[ : , 1]로 설정을 하게 되는데, 다중분류 문제에서 농약검출여부 중 어떤 결과값을 물어보지 않게 되면 pred [ : , 0 또는 1또는 2]를 적용할 수 없어 roc_auc는 사용할 수가 없는 것인지 궁금합니다~!
작업형 2에서 ligtGBM 적용시 인코딩 필요없다고 하셨는데 기출 풀이에서는 원핫 인코딩이 된 이후에 적용하신 거로 보입니다. 원핫 인코딩 후 ligt GBM을 사용해도 되는 건가요? 만약 기출풀이처럼 원핫 인코딩을 하지 않았을때는 카테고리화 작업을 한 후에 ligtht GBM을 적용하면 되는건가요?
안녕하세요 규원님. 강의 잘 듣고 있습니다. 제가 실습 코드를 따라하다가 오탈자가 생겨 이를 해결하는 과정에서 의문점이 생겨 질문 남깁니다. shopper 토큰 발급 엔드포인트 구현 과정에서 @RequestBody 어노테이션을 누락했습니다 @PostMapping("/shopper/issueToken") ResponseEntity<?> issueToken(IssueShopperToken query) { return repository.findByEmail(query.email()) .map(shopper -> composeToken()) .map(AccessTokenCarrier::new) .map(ResponseEntity::ok) .orElseGet(() -> ResponseEntity.badRequest().build()); } 문제는 이런 상황에서 400이 발생하며 실패해야할 테스트 코드가 통과하게 됩니다. @Test void 잘못된_비밀번호가_사용되면_400_Bad_Request_상태코드를_반환한다( @Autowired TestRestTemplate client ){ // Arrange var email = generateEmail(); var wrongPassword = generatePassword(); var password = generatePassword(); client.postForEntity( "/shopper/signUp", new CreateShopperCommand(email, generateUsername(), password), Void.class ); // Act ResponseEntity<AccessTokenCarrier> response = client.postForEntity( "/shopper/issueToken", new IssueShopperToken(email, wrongPassword), AccessTokenCarrier.class ); // Assert assertThat(response.getStatusCode().value()).isEqualTo(400); } 이유를 고민해보고 다음과같은 결론을 짓게 되었습니다. @RequestBody 가 없는 경우 컨트롤러 메서드의 매개변수는 기본적으로 form data로 인식하게 된다. 따라서 IssueShopperToken 이 form data로 인식되게 된다. 현재 테스트에서는 상태코드가 400인지만을 확인한다. 하지만 form data가 없는 경우에도 400이 발생한다. 테스트가 통과한다. 거짓 양성의 사례라고 보여집니다. 이경우에는 Assert절을 강화해 상태코드 말고도 검증되어야할 항목들을 추가해 거짓 양성을 방지할 수 있을거라고 생각됩니다. 이렇듯 테스트코드도 사람이 작성하다 보니 Assert절을 어느정도 수준까지 구체적으로 작성해야 할지를 TDD가 익숙하지 않다면 빠르게 식별하기 어렵다고 생각합니다. 실무에서는 이와같은 상황은 매우 치명적일 수 있을거 같고요. 그래서 실무에서 필요한 Assert절을 구체화하는 명확한 기준이나 노하우가 있으신지가 궁금합니다!
안녕하세요. 빅데이터분석기사 실기 강의를 작년에 결제했었는데 개인사정으로 시험을 못보다가 이번에 시험을 치게 됐습니다. 현재 강의가 6월 12일에 끝나는데 혹시 강의가 이번 실기 시험 전날인 6월 20일까지 연장이 가능할까 하여 문의드립니다 ㅠㅠ 메일주소는 yjm7252@gmail.com 입니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 sklearn 관련해서 코랩에서 dir 을 쓰면 엄청 많이 나오는데 실제 체험환경 들어가서 쓰니까 자주 사용하는 dir은 다 안보이더라구요 원래 이런건가요?? 아니면 체험환경에서만 제공을 안하는건지 궁금합니다
제2유형 결측치 채우기 어떻게 진행해야되나요? 물론 기출에는 결측치 있는 문제가 안나왔지만, 시험환경 test에는 결측치가 있었고, fillna(0)으로 했는데, 수치 차이가 많이 나는 것 같습니다. 평균치 mean() 또는 중앙값 median()으로 정리하는게 맞을까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 9회 작업형3 문제 2-1에서 로지스틱 회귀 모형을 적합할 때 독립 변수 중 MonthlyCharges (월 사용 요금) CustomerTenure (고객 유지 기간) HasPhoneService (전화 서비스 이용 여부) HasTechInsurance (기술 보험 가입 여부) HasPhoneService, HasTechInsurance는 '여부'에 대한 것이고 결과값도 0,1로 나타나니 범주형으로 간주해야 하는 것은 아닌가요? 저는 이런 식으로 C()로 묶어서 적합했는데, 풀이에서는 그렇게 하지 않으셨어서, 어떻게 하는 게 맞는지 문의드립니다. from statsmodels.formula.api import logit model = logit('Churn ~ MonthlyCharges + CustomerTenure + C(HasPhoneService) + C(HasTechInsurance)', data=df).fit()
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 다름이 아니라 작업형2 풀 때 대부분은 검증데이터 분리하는 것 (홀드아웃) 으로 풀이를 해주셨는데, 한 번은 교차검증으로 알려주셨는데요 챗지피티한테 제 작업형2 코드를 평가해달라고 하면 항상 교차검증을 하는 게 더 낫다고 답변을 줘서요 실제로 평가기준 점수를 비교했을 때 교차검증일 때가 평가지표가 더 높은 경우가 많았습니다. 혹시 둘 중에서 아무거나 사용해도 되는지, 교차검증을 사용하는 게 나은지, 안전하게 홀드아웃 - 검증데이터 분할을 추천하시는지 여쭙습니다.