안녕하세요 강사님. 작업형2 관련해서 문의 드릴게 있습니다. 작업형2에서는 하나의 학습 모델을 잡고, 여러가지 퓨처엔지니어링, 하이퍼파라미터등을 통해 성능을 끌어 올리는게 더 높은 점수를 받는 것인지, 아니면 여러 학습 모델 ex)랜덤포레스트, lightgbm, linear_model 등을 통해 가장 높은 성능을 보이는 학습 모델을 제출하는 것이 더 높은 점수를 받는 것인지 궁금합니다. 각각의 학습 모델마다 성능이 다르게 나와서, 그냥 높은 성능을 보이는 모델을 제출하면 되는걸까요? 어디에 중점을 둬야 할 지 모르겠어서 문의 남깁니다.~!! 감사합니다
좋은 영상 잘보며 열공 하고 있습니다. 질문1 . 유형2에서 결과 제출할때 pred 이란 변수를 사용하는데, 어떤 책에선 y_pred 이란 변수를 사용하기도 하더라구요. 문제를 읽었을때 변수명에 대한 설명은 없어보이는데, 정해진 변수명이 있나요? 질문2. 유형2는 성능 측정모형(mse, rmse 등)을 알려주고 있습니다. 제가 만약 분류도, 회귀도 무조건 랜덤포레스트만 사용하겠다고 하면 사실 저 성능 측명하는건 굳이 코드에 안짜도 되지요? 채점답변이 csv 파일만 적절하면 되는게 맞는지요?
전처리, 피처엔지니어링 할 때, 언제 무엇을 해야할지 헷갈립니다. 가령 데이터가 어떨 때, 어떤 것을 스케일링 해야하는지 헷갈립니다. 기출문제 풀이에서 스케일링을 한 경우도 있고, 안 한 경우도 있다보니 정리가 잘 안되는 느낌입니다. get_nc_data로 n과 c를 나눴다가 다시 concat으로 합친 경우가 있는가 하면, 어떤 회차에서는 그냥 스케일링도 없이 원핫인코딩만 해버리는 경우도 있어서, 언제 어떤 방식으로 전처리를 해야할지 감이 잘 안옵니다. 저런 기준을 잘 모르겠습니다. 또, target열을 value_counts()하는 것은 알겠는데, 어떤 회차에서는 또 이것을 pop하기도 해서, 어떨때 pop을 하는 것인지도 분간이 잘 안갑니다ㅠ 로그, 지수 수치 변환도, 수치형 데이터가 어떨 때 하고 어떨 때 안하는지 헷갈립니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 선생님! 2회 기출유형 (작업형1) 5분경에 df.iloc를 통해서 10개의 데이터를 대체하는 게 있는데요, 이전에 판다스 강의하실 때 iloc의 경우 :10이면 9까지만 포함되는 걸로 기억하는데 제 기억이 잘못된 걸까요? loc는 [0:9]면 9까지고, iloc는 [0:9]면 8까지로 기억하는데 헷갈리네요 ㅠㅠ 한 번만 다시 설명 부탁드립니다.
학습하는 분들께 도움이 되고, 더 좋은 답변을 드릴 수 있도록 질문전에 다음을 꼭 확인해주세요. 1. 강의 내용과 관련된 질문을 남겨주세요. 2. 인프런의 질문 게시판과 자주 하는 질문(링크)을 먼저 확인해주세요. (자주 하는 질문 링크: https://bit.ly/3fX6ygx) 3. 질문 잘하기 메뉴얼(링크)을 먼저 읽어주세요. (질문 잘하기 메뉴얼 링크: https://bit.ly/2UfeqCG) 질문 시에는 위 내용은 삭제하고 다음 내용을 남겨주세요. ========================================= [질문 템플릿] 1. 강의 내용과 관련된 질문인가요? (예/아니오) 2. 인프런의 질문 게시판과 자주 하는 질문에 없는 내용인가요? (예/아니오) 3. 질문 잘하기 메뉴얼을 읽어보셨나요? (예/아니오) [질문 내용] 여기에 질문 내용을 남겨주세요. 안녕하세요 강의 정말 잘 듣고있습니다 !! 강의 30:00 부근에서 TABLE_PER_CLASS 전략이 왜 안좋냐면 조회시 부모 클래스로 조회를 할 수도 있는데 그런경우에 UNION 쿼리가 나가는 단점이 있다고 하셨습니다. 그래서 전략을 JOINED로 바꾸고 실행해봤는데 이런식으로 LEFT JOIN을 여러번 하게 되고 SINGLE TABLE 전략은 예상한대로 이런 결과가 나오더라구요. 이 결과들만 보면 SINGLE TABLE이 말씀하신것처럼 심플하게 조회가 되고, JOINED와 TABLE PER CLASS 는 사실 성능상 비슷해보이는데 TABLE PER CLASS 전략만 단점을 소개해주셔서 질문드렸습니다. 질문은 한마디로, JOINED도 성능이 그렇게 좋진 않은것 아닌가?? 입니다!! 읽어주셔서 감사합니다.
too many indices for array: array is 1-dimensional, but 2 were indexed 저장을 하려면 이런 오류가 자꾸뜨는데 확인부탁드립니다. submit=pd.DataFrame({'CLIENTNUM':test_id, 'Attrition_Flag': pred[:,1]})
mean /mean_se/mean_ci_lower/mean_ci_upper/obs_ci_lower/obs_ci_upper/ 6회 기출문제 작업형3 마지막 문제 신뢰구간 구하는 문제에서 위와 같이 표가 나왔는데요. obs_ci_lower/obs_ci_upper 이 구간이 아니고 mean_ci_lower/mean_ci_upper 이 구간 인건가요?
강의 수강 중 궁금한 점이 있어 질문드립니다. s3 배포 시 제약조건? 멀티 프로바이더 부분에서 s3 배포 시, 서울 리전에만 배포가 안됩니다. (still creating 무한루프) 제가 배포하려는 코드는 아래와 같습니다. # provider.tf provider "aws" { region = "ap-northeast-2" } provider "aws" { alias = "apne3" region = "ap-northeast-3" } # main.tf resource "aws_s3_bucket" "apne2" { bucket = "tf-apne2-hb" } # 오사카 리전 resource "aws_s3_bucket" "apne3" { bucket = "tf-apne3-hb" provider = aws.apne3 } 서울 리전에 배포할 때 해당 버킷명을 사용할 때만 배포가 안되며, 다른 버킷명이나 다른 리전에 배포하면 잘 배포가 됩니다. 콘솔에서 위와 동일하게 생성해보면 "the ap-northeast-2 location constraint is incompatible for the region specific endpoint this request was sent to." 와 같은 에러가 떨어지는데 처음보는 경우라 혹시 알고 계신게 있는지 궁금해서 질문 남깁니다. vpc 배포 후 provider 변경 resource "aws_vpc" "apne2" { cidr_block = "10.0.0.0/16" } resource "aws_vpc" "apne3" { cidr_block = "10.0.0.0/16" } 위처럼 배포 시 서울 리전에 vpc가 2개 생성됐습니다. 이후 apne3 vpc 리소스에 provider = aws.apne3 을 추가한 후 plan 해보면 서울 리전에 vpc가 삭제되고 오사카 리전에 생기는게 아닌, 서울 리전에도 남고 오사카 리전에도 새로 추가가 됩니다. tfstate 파일에서도 provider와 속성값들이 변경은 되는데 기존 리소스는 왜 삭제되지 않는지 궁금합니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 좋은 강의 감사드립니다.작업형2번에서 데이터를 분리할 때 train, target 2.train(타겟드랍), train(타켓) 이렇게 train을 그대로 쓸 때와 타겟을 없앤 train을 쓸 때의 차이가 헷갈립니다. 그리고 타겟으로 뺄 때외 안뺄때는 편의 차이인지 이유가 있는지 궁금합니다. 감사합니다.
안녕하세요~ 작업형3 C() 관련해서 이렇게 이해하면 될까요? 범주형 값일 때, 경우1. ols(회귀), logit(로지스틱회귀) 문자형 → 자동 처리 수치형 → C() 경우2. 분산분석 독립변수 == 범주형 변수 → 숫자만 C()로 묶어도 되고, 독립 변수 모두를 각각 C()로 묶어도 됨 항상 좋은 강의 감사합니다! 😊
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 cond1 = df['age'].mean() + df['age'].std() * 1.5 cond2 = df['age'].mean() - df['age'].std() * 1.5 out1 = df['age'] > cond1 out2 = df['age'] < cond2 print(df['age'][out1 | out2].sum()) print(df[(cond1)|(cond2)]['age'].sum()) 아래 코딩처럼 cond1 ,cond2 를 괄호로 묶으신 이유가 있을까요?? 위 방법처럼 묶지 않았을 때 같은 정답 나왔습니다!
뭔가 알면 알수록 계속 욕심이 생깁니다.. (시험 때 어떻게든 score를 높이기 위해..) 총구매액, 최대구매액, 환불금액 같은 경우는 숫자가 너무나도 크기 때문에, StandardScaler를 쓰면 좋을 것 같아 보입니다. StandardScaler는 그 해당 컬럼 값의 max값과 min값이 1000이상 차이나면 사용하면 좋을까요? 어떤 경우에 쓰면 좋을지 방향성을 알고 싶습니다.
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 판다스에서 .corr사용했을 때 오류가 떠서 numeric_only=True같이 입력했는데 시험때도 써야하나요?
현재 특정날에 (예: 2024.06.20 11:00) 에 쿠폰을 배포하는 서비스를 구현하려고 합니다. 흔히 배민에서도 이런 이벤트를 진행하는 걸로 알고 있고, 쿠폰은 아니지만, 인강 사이트 등에서 프리패스 상품을 오픈할 때 특정 날에 활성화돼서 해당 상품을 구매할 수 있도록 하는 것으로 알고 있습니다. 이외에도 콘서트 티케팅 오픈, 수강신청 오픈 등등 이러한 서비스를 구현하고자 하는데, 어떤 키워드로 검색을 하여 접근할지 감이 안옵니다.... 이것과 관련하여 어떤 키워드로 접근하면 좋을지 조언을 부탁드립니다.