LabelEncoder를 해도 되고 원핫 인코딩을 해도 아무 상관이 없나요 예를 들면 기출 6 작업형 2에 LabelEncoder를 쓰니 성능이 잘 나오는데 성능이 잘 나오는 것으로 쓰면 되는 지요 그리고 작업형 어떤 ensemble을 쓰던 적당한 값이 나오면 40점을 받을 수 있는 것인가요? metrics으로 자체 확인을 하지 않고 내더라도 낸 결과가 적당한 결과이면 점수를 받는 것인가요? 순전히 시험 점수 측면 획득 측면에서 여쭤 봅니다. 시험이 아니라면 이것 저것 해보겠지만 시험에서는 실수하는 것보다 단순하게 하는 것이 좋을 것 같습니다. 보통 RandomForest로 해도 적당한 결과가 나오는데 과거 기출 기준에서는 validation 예측/비교 없이(생략하고) 1~2개의 기법으로 test값만 예측해도 되는 것인지요
t3-logit-py # 문제 1-2: 독립변수 income만 사용해 학습한 모델에서 test 데이터의 purchase를 예측하고, 정확도 계산 predictions_income = result_income.predict(test) predicted_classes_income = (predictions_income > 0.5).astype(int) 이 문제에서 왜 prediction_income > 0.5를 하는건가요 ?
안녕하세요! 회귀 코드를 보던 중 궁금한 점이 생겨 질문 남깁니다. 강의에서는 원핫인코딩 전에 describe(include= 'object')를 통해 train, test의 범주형 데이터 unique 수가 일치하는 것만 확인하고, train/test 병합 작업 없이 원핫 인코딩을 수행했습니다. 제가 실습하는 중에, train/test의 각 unique값을 출력했는데 캡쳐본과 같이 smoker 에서 yes,no의 순서가 바뀌어서 나왔습니다. 이 경우에는 unique값의 종류는 같지만, 병합 없이 각자 인코딩을 할 경우 train 데이터 -> yes:0, no:1 test 데이터 -> no:1, yes:1 와 같이 인코딩되지 않을까 생각이 들었습니다. unique 종류만 일치하면, 순서가 다르더라도 따로 병합하여 인코딩 하지 않아도 되는 것일까요?
보니깐 int와 str이 혼합되어서 뜬것 같은데.. cols = X_train.select_dtypes(include = 'object').columns print(list) from sklearn.preprocessing import LabelEncoder cols = X_train.select_dtypes(include = 'object').columns le = LabelEncoder() for col in cols : le = LabelEncoder() X_train[col] = le.fit_transform(X_train[col]) X_test[col] = le.transform(X_test[col]) 그래서 이렇게 cols라는 코드를 사전에 지정해줬는데... 왜 뜰까요? 처음부터 숫자와 str 데이터를 분리해서 인코딩 했어야 할까요?
1. 현재 학습 진도 1-5 알고리즘과 친해지기(2) 2. 어려움을 겪는 부분 # def find_max_occurred_alphabet(string): # alphabet = [0] * 26 # for i in string: # if i.isalpha(): # alphabet[ord(i) - ord('a')] += 1 # # max = alphabet[0] # index = 0 # for i in range(len(alphabet)): # if alphabet[i] > max: # max = alphabet[i] # index = i # # return chr(index+ord('a')) from collections import Counter def find_max_occurred_alphabet(string): string = [char for char in string if char.isalpha()] counter = Counter(string) print(counter) return max(counter, key=counter.get) result = find_max_occurred_alphabet print("정답 = i 현재 풀이 값 =", result("hello my name is dingcodingco")) print("정답 = e 현재 풀이 값 =", result("we love algorithm")) print("정답 = b 현재 풀이 값 =", result("best of best youtube")) 3. 시도해보신 내용 안녕하세요. 첨부한 코드 중 주석 처리한 부분은 문제를 보고 사전에 제가 작성한 코드입니다. 결과는 예상과 동일하게 출력됩니다. 그 밑에는 다른 풀이 방법을 찾다가 Counter 클래스를 사용하여 작성한 코드입니다. 본 강의에서는 카운터가 동일한 경우, 기존의 값을 변경하지 않는 방식이라 i가 출력되지만, 해당 방법을 사용하면 입력 순으로 o가 출력됩니다. 이 경우 최빈값을 찾아내는 코드는 맞지만, 값이 동일한 경우에 처리하는 로직이 다르기 때문에 발생한다고 이해하면 될까요? 답변해주신다면 감사하겠습니다.
안녕하세요 일코님,, 업무들을 순차적으로 자동화 하는데 많은 도움을 받았습니다. 이제 또 새로운 문제에 직면을 했는데요, pyinstaller로 배포파일 빌드 시 자꾸 알약에 탐지가 됩니다. 직원들에게 배포하고 사용하면서 알약에 바이러스 파일로 탐지가 된 것인지 모르겠지만 어느 순간부터 탐지되어 삭제가 되네요. 이것저것 조치하다가 pyinstaller -F -w 에서 -w를 제외하고 배포하니 또 탐지가 안 되었다가, 하루 지나니 제외한 파일도 탐지가 됩니다. 혹시 이 경우도 있었는지요? 프로그램의 과정이 아니라 배포의 과정에서 이러니 너무 답답합니다..
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 캐글 필사 전략 강의를 수강하며 캐글에서 타이타닉 문제를 풀어보고 있는 중인데 궁금한 점이 있습니다. 살아남은 여성의 확률을 구할 때 women = train_data.loc[train_ data.Sex == 'female']["Survived"] rate_women = sum(women)/len(women) print("% of women who survived:", rate_women) 이 코드를 작성하는데 여기서 sum(women)의 값과 len(women)의 값이 왜 다른지 궁금합니다. sum의 경우에도 살아남은 여성의 수를 계산하고 len의 경우에도 리스트의 개수를 리턴하기 때문에 동일한 값이라고 생각했습니다. len함수와 sum 함수의 차이가 궁금합니다.
19:28 문제 vegetables = {"carrot", "broccoli", "spinach", "carrot", "lettuce"} set 형태는 중복을 불가하지 않나요? carrot이라는 값이 이미 2개 존재하는 모순이 생깁니다. 아니면 어떤 것이 중복 불가한가요? 제가 무엇을 잘못 알고 있나요?