현재 특정날에 (예: 2024.06.20 11:00) 에 쿠폰을 배포하는 서비스를 구현하려고 합니다. 흔히 배민에서도 이런 이벤트를 진행하는 걸로 알고 있고, 쿠폰은 아니지만, 인강 사이트 등에서 프리패스 상품을 오픈할 때 특정 날에 활성화돼서 해당 상품을 구매할 수 있도록 하는 것으로 알고 있습니다. 이외에도 콘서트 티케팅 오픈, 수강신청 오픈 등등 이러한 서비스를 구현하고자 하는데, 어떤 키워드로 검색을 하여 접근할지 감이 안옵니다.... 이것과 관련하여 어떤 키워드로 접근하면 좋을지 조언을 부탁드립니다.
앞에서부터 70% 데이터 중 views 컬럼의 3사분위 수에서 1사분위 수를 뺀 값을 아래와 같이 풀이했는데, 코드가 실행되지 않는 이유가 궁금합니다. df = df[:int(len(df) * 0.7)] cond3 = df['views'].quantile(0.75) - df['views'].quantile(0.25) df[cond3]
여유 없으면 랜덤포레스트 모델 하나만 해도 크게 지장없는 걸로 알고 있습니다. 근데 모델 구성 중에 max_depth 이나 random_state에 따라 점수가 차이가 날 수 있는 건 당연한데, 이 차이가 많이 날 수 있나요...? 저번 시험에서 max_depth 설정한 사람과 안한 사람 차이 점수가 10점 이상 난 걸로 알고 있어서...ㅠ 그리고 예를들어 모델 검증으로 max_depth=7이 max_depth=5가 더 좋은 평가지표가 나왔는데, 실제 test랑 비교했을 때 max_depth=5가 더 좋을 수 있는 것 아닌가요...?
T1-21 문제 풀어보고 있는데요, 캐글에서 올려주신 코드로 작성한 결과와 제가 작성한 코드의 결과가 달라 질문 드립니다. (*제가 작성한 전체 코드는 맨 아래에 있습니다.) 바로 아래 코드에 대한 출력값은 90, 30, 30, 30 입니다. (답은 167.0 으로 출력됩니다.) 이를 통해 이상값 처리와 데이터 분할 모두 옳게 했다고 볼 수 있는데, 답은 165가 아닌 167이 나와서 도대체 어디서 잘못된건지 모르겠습니다. 답변 주시면 감사하겠습니다! # print(len(df['age'])) # print(len(df['age'].iloc[:30])) # print(len(df['age'].iloc[30:60])) # print(len(df['age'].iloc[60:90])) import pandas as pd import numpy as np df = pd.read_csv('../input/bigdatacertificationkr/basic1.csv') # print(df.head()) # print(df.info()) cond1 = df['age'] > 0 cond2 = df['age'] == round(df['age'], 0) df = df[cond1 & cond2] # print(df.head()) # print(len(df['age'])) # print(len(df['age'].iloc[:30])) # print(len(df['age'].iloc[30:60])) # print(len(df['age'].iloc[60:90])) median1 = df['age'].iloc[:30].median() median2 = df['age'].iloc[30:60].median() median3 = df['age'].iloc[60:90].median() print(median1+median2+median3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 안녕하세요 작업형 2 한 가지 방법으로 풀기를 봤는데요 지금까지는 결측치나 이상치가 없었던 것으로 알고있는데요 1.만약 8회차에 결측치나 이상치가 존재한다면 여기서 EDA이후 결측치나 이상치를 제거하고 인코딩으로 넘어가면 되는거죠?? 2.그리고 영상에서는 target빼고 원핫 인코딩으로 다 진행 하던데 혹시나 조금 더 꼼꼼하게 진행할려면 target데이터 제외후 범주형은 원핫 인코딩 수치형은 스케일링 돌린후 검증 데이터 나누고 randforest로 학습 및 평가 후 제출 하면 되는 걸 까요??
캐글에 올려주신 자료 중 T1-23 문제를 다시 풀어보고 있는데 선생님 답과 다른 답이 나와서 질문 드립니다. 선생님 풀이와 다른 부분은 10번째 값을 찾는 부분만 다른 코드로 했는데요 10번째 값은 88으로 같은데 중복값 제거 후 f1 중앙값이 75로 선생님 풀이의 값 77과는 다르게 나옵니다. 이유가 뭔지 알 수 있을까요? # f1 결측치를 f1을 내림차순으로 소팅했을 때 10번째 인덱스에 위치한 값으로 채움 df=df.sort_values('f1', ascending=False) df=df.reset_index() # print(df.head(10)) a=df.loc[9,'f1'] print(a) # print(df.isnull().sum()) df['f1']=df['f1'].fillna(a) # print(df.isnull().sum()) # age컬럼의 중복 제거 전 f1중앙값 m1=df['f1'].median() print(m1) # age컬럼의 중복 제거 후 f1중앙값 print(df.shape) df=df.drop_duplicates(subset=['age']) print(df.shape) m2=df['f1'].median() print(m2) print(abs(m1-m2))
학습하는 분들께 도움이 되고, 더 좋은 답변을 드릴 수 있도록 질문전에 다음을 꼭 확인해주세요. 1. 강의 내용과 관련된 질문을 남겨주세요. 2. 인프런의 질문 게시판과 자주 하는 질문(링크)을 먼저 확인해주세요. (자주 하는 질문 링크: https://bit.ly/3fX6ygx) 3. 질문 잘하기 메뉴얼(링크)을 먼저 읽어주세요. (질문 잘하기 메뉴얼 링크: https://bit.ly/2UfeqCG) 질문 시에는 위 내용은 삭제하고 다음 내용을 남겨주세요. ========================================= [질문 템플릿] 1. 강의 내용과 관련된 질문인가요? (예/아니오) 2. 인프런의 질문 게시판과 자주 하는 질문에 없는 내용인가요? (예/아니오) 3. 질문 잘하기 메뉴얼을 읽어보셨나요? (예/아니오) [질문 내용] 안녕하세요. 질문이 생겨서 글을 남깁니다. 저가 이것저것(아픔 + 번아웃..등)이 있어서 한 2주 정도 인가요? 코딩하는데 거의 손을 놓고 있엇습니다.(해 봐야 30분에서 2시간이하 정확히는 기억이 안남 ,아니면 아에 안함 ) 그리고 나서 날짜와 시간 사이에서 너무 막혀서(캘린더 는 정말 싫네요.. 하신 분들 존경 합니다.) 에라이 전에 있던 문제 풀이나 복습 해보자 하고 하였는데.. String챕터 문제 풀이 부터 막히더라고요.(문제와 풀이만 보고서여.pdf파일에 있는 내용 참조 안함) 그래서 다시 보고 있긴 한데, 시간이 지나고 나서( ex)예외처리까지 챕터 까지했을때 - 7월달까지 중급2편을 끝내고 싶었는데.. 역시 계획 대로는 안되네요...), 저가 이것들을 할 수 있을까 하는 의문이 들더라고요. 이럴 때에는 어떻게 해야 하는지 궁금합니다. 지금은 저가 중요하다고 생각하는 것을 손코딩 + 동영상 보면서 코드 를 지우고 다시 침, 이렇게 하고 있긴 한데 더욱 좋은 방법이 있을까요? 아니면 지금 이대로 계속 하는 게 맞는 방법인가요? 답변 부탁드립니다.
상위 10번째 값으로 대체하는 부분에서 df.iloc[:10,-1] = min_value 이렇게 하셨는데 df['views'].iloc[:10]= min_value 이렇게 풀어도 상관없을까요? 만약 2번째 풀이도 상관 없다면 첫번째 풀이로 진행하신 이유가 있을까요? 취향차이일까요?
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 정규성을 만족하지 않을 때 단일 표본과 대응 표본에서 윌콕슨을 사용하려고 합니다. 이때 단일 표본 stats.wilcoxon(df['관측치명']-평균값, alternative=) 라 했을 때 차이로(df['관측치명']-평균값) 계산하였고 대응표본은 차이로 계산이 가능하지만, 더 쉬운 방법인 df['before'], df['after'], alternative= 를 사용하였습니다. 그렇다면 단일표본에서도 df['관측치명'], 평균값으로 계산해서 될까요? 만일 안된다면, 윌콕슨은 차이 값를 기반으로 검정 통계량을 계산하는 것인데 대응표본은 두가지로 가능하면서 단일표본은 무조건 왜 -(차이)를 사용해야 하는지 궁금합니다!
[질문 템플릿] 1. 강의 내용과 관련된 질문인가요? (예/아니오) 2. 인프런의 질문 게시판과 자주 하는 질문에 없는 내용인가요? (예/아니오) 3. 질문 잘하기 메뉴얼을 읽어보셨나요? (예/아니오) [질문 내용] NetworkClient 클래스, SendException 클래스, ConnectException 클래스들의 필드를 캡슐화로 외부에서 상태 변경을 막았는데 왜 final로 정의한 이유가 궁금합니다.
강의 내용중 Comparable, Comparator 파트에서 List 데이터를 정렬할 때 Collections.sort() 와 list.sort() 중 list.sort를 권장하는 이유를 조금 더 자세히 알고 싶습니다. 이 부분에서 list.sort()를 사용하는 게 더 객체지향적인 코드 라고 말씀해주셨는데 List 인터페이스에 정의된 sort() 메서드를 사용하는 게 Collections class 에 정의된 static 메서드보다 어떤 측면에서 더 객체지향적인지 느낌은 오는데 이것 때문이다 라고 정리가 잘 안돼서 질문 드립니다. Collections 의 코드를 봤을 때 내부에서 Collections.sort(list, comparator)를 보게되면 list.sort(comparator) 메서드를 사용하고 있는데 그러면 굳이 Collections.sort()를 사용해야 할 케이스가 따로 있어서 정의한 것인지 어떤 경우에 사용하는지 궁금합니다. public static <T> void sort(List<T> list, Comparator<? super T> c) { list.sort(c); }