라소,릿지 gridsearchcv에서 알파값관련
미해결
[개정판] 파이썬 머신러닝 완벽 가이드
알파값을 릿지는 0.05,0.1,1,5,8,10,12,15,20 라소는 0.001,0.005------ 이렇게 잡는 이유와 기준이 무엇인지? 그냥 경험치인건지
- python
- 머신러닝
- 통계
172만명의 커뮤니티!! 함께 토론해봐요.
미해결
[개정판] 파이썬 머신러닝 완벽 가이드
알파값을 릿지는 0.05,0.1,1,5,8,10,12,15,20 라소는 0.001,0.005------ 이렇게 잡는 이유와 기준이 무엇인지? 그냥 경험치인건지
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
# your code import pandas as pd df = pd.read_csv("members.csv") df.head() #views 컬럼에 결측치가 있는 데이터(행)을 삭제하고 df.isnull().sum() #views에 결측치 4개 # print(df.shape) df = df.dropna(subset = ['views']) # print(df.shape) #f3 컬럼의 결측치는 0, silver는 1, gold는 2, vip는 3 으로 변환한 후 총 합을 정수형으로 출력하시오 df['f3'] = df['f3'].fillna(0) df['f3'] = df['f3'].replace('silver', 1) df['f3'] = df['f3'].replace('gold', 2) df['f3'] = df['f3'].replace('vip', 3) # print(df.head(20)) print(int(df['f3'].sum())) numpy 안 쓰고 이렇게 작성해도 되나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
3사분위수 - 1사분위 수 값을 구할 때 선생님 처럼 r2, r1 변수 안 만들고 df = df[:int(len(df) * 0.7)] #70% 데이터 선택 IOQ = df['views'].quantile(.75) - df['views'].quantile(.25) print(IOQ) 이렇게 구해도 되나요?
미해결
Practical Testing: 실용적인 테스트 가이드
요즘 서비스 계층 단위테스트를 위해 모킹과 fake 객체 구현을 공부하고 있습니다. 하지만 레포지토리를 일일이 모킹하는 코드를 작성하는 것이 빠른 피드백이 장점인 단위테스트로 의미가 있는지 의문이 들 정도로 시간이 많이 들더라고요. 그래서, 좀 더 효율적인 강사님의 방식을 따라가고 싶어 강의를 듣던 중 의문이 생겨서 질문드립니다. 1. 계층별 테스트 분리 기준에 대한 질문입니다. 컨트롤러, 레포지토리는 단위테스트, 서비스 계층은 레포지토리 부분과 통합테스트 이렇게 분리해서 진행하셨던 이유를 여쭤봐도 될까요? 서비스, 컨트롤러, 레포지토리 계층 각각 단위테스트를 작성하고 컨트롤러에서 레포지토리까지 한번 통합테스트를 작성하는 방법도 있을 것 같고, 묶어볼 방법은 몇 가지 더 있는 것 같습니다. 그런데 강의에서처럼 분리했던 게 가장 효율적이라고 생각하는 기준과 이유…. 이 분리 방식의 발견 과정이 너무 궁금하네요 2. 통합테스트 DB 관련 질문입니다. 서비스계층과 레포지토리 계층을 묶은 상태로 H2 같은 임베디드 데이터베이스를 사용하면 테스트 속도가 상당히 느리게 나오긴 합니다. 이런 부분은 어쩔 수 없이 안고 가는 것인가요? 그리고 운영이나 개발 DB를 postgress같이 H2말고 다른 걸 사용한다고 해도, H2로 통합테스트 테스트하는게 이점이 있을까요? 3. 서비스 계층 단위테스트 관련 질문입니다. 혹시, 부담이 안 된다면, 서비스 계층의 단위테스트가 중요도가 많이 떨어진다고 생각하시는 이유가 Fake든 Mockito를 사용한 Stub이든 데이터베이스를 흉내만 내는 테스트가 의미가 없다고 여기셔서 그런 것일까요? 부족한 질문 읽어주셔서 감사합니다!
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
제가 푼 내용을 보면 pred = rf.predict(test) : 질문자 pred = rf.predict(x_val) : 해설 위 두가지가 다릅니다. 해당 건 때문에 pred 했을 때, 값 차이가 많이 나는건가요? ㅜ_ㅠ 챗gpt에 물어보니 어떨때는 test고 어떨대는 x_val인지 아직도 모르겠습니다. # 라이브러리 및 데이터 불러오기 import pandas as pd train = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_train.csv") test = pd.read_csv("https://raw.githubusercontent.com/lovedlim/inf/refs/heads/main/p4/8_2/churn_test.csv") # train.info() # test.info() target = train.pop('TotalCharges') train = pd.get_dummies(train) test = pd.get_dummies(test) train, test = train.align(test, join='left', axis=1) from sklearn.model_selection import train_test_split x_tr, x_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0) from sklearn.ensemble import RandomForestRegressor rf = RandomForestRegressor(random_state=0) rf.fit(x_tr, y_tr) pred = rf.predict(test) submit = pd.DataFrame({'pred' : pred}) submit.to_csv('result.csv', index=False) ans = pd.read_csv('result.csv') print(ans)
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
'age' 컬럼의 이상치(소수점 나이와 음수나이, 0포함)를 제거하고 제거 전 후의 views 컬럼 표준편차를 더하시오 (최종 결과 값은 소수 둘째자리까지 출력, 셋째자리에서 반올림) 제가 생각한 이상치 제거는 1. 사분위수를 이용해서 1차적으로 이상치를 제거하고 1번을 통해 필터링 된 데이터에서 0, 음수, 소수 데이터를 제거 라고 생각했는데 아닌가요? 답은 우연인지 의도인지 둘다 8420.69 이 나오긴 했습니다 import pandas as pd df = pd.read _csv( " https://raw.githubusercontent.com/lovedlim/inf/main/p1/members.csv " ) bef = df[ 'views' ].std() #1 #0, 음수 제거 -> 소수 제거 # opt6_1 = df['age'] <= 0 # df= df[~opt6_1] # opt6_2 = df['age'] % 1 == 0 # df = df[opt6_2] # aft = df['views'].std() # print(round(bef+aft, 2)) ###### 8420.69 출력 #2 # 이상치 제거 -> 0,음수 제거 -> 소수제거 Q1 = df[ 'age' ].quantile( 0.25 ) Q3 = df[ 'age' ].quantile( 0.75 ) IQR = Q3 - Q1 cond1 = df[ 'age' ] > Q3 + ( 1.5 * IQR) df = df[~cond1] cond2 = df[ 'age' ] < Q1 - ( 1.5 * IQR) df = df[~cond2] cond3 = df[ 'age' ] <= 0 df = df[~cond3] cond4 = df[ 'age' ] % 1 == 0 df = df[cond4] aft = df[ 'views' ].std() print ( round (aft + bef, 2 )) ###### 8420.69 출력
해결됨
[AI] 프롬프트만으로 아이디어 구현하기_바이브코딩 입문
아래 질문 대댓글로 올렸는데, 잘 못보실것같아 이곳에 정식으로 올립니다. 모든 프로그램 설치 후, 재부팅, 커서 재실행등은 다 해봤습니다. ============================= 처음 코드를 만들고 gtts에서 에러가 나네요. 선생님의 코드 요청과 똑같이 요청을 했고, 그래서 아래와 같은 코드가 생성되었습니다. 그래서 pip install -r requirements.txt 를 터미널에 입력 시켜주었으며 위와 같이 제대로 설치가 된것 같습니다. requirements.txt 내용 -> gTTS==2.3.2 그랬는데 아래와 같이 Python cmd창에서 에러가 납니다. (대소문자 에러인줄알고 그마저도 고쳤는데도) gtts가 설치가 된것 같은데 왜 불러오질 못하는지 모르겠네요 ㅠㅠ(참고로 코알못입니다) 커서도 여러번 껐다가 재실행했는데도 꼭 저러네요.. 이것저것 만져보기도 겁다고한데... 해결 방법 좀 알려주시면 감사하겠습니다.! ======= 혹시 추가 정보가 필요하신게 있으면 알려주시면 바로 확인해서 올리겠습니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
len함수로 세서 나누기 2를 하는 코드로 알려주셨는데 len(df)*0.5) 이렇게 작성해도 될까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
시험환경에서는 문제가 최소 최대 척도인데 강의에서 보이는 문제랑 다른데요.. 제가 잘 못들어간 것일까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
풀이과정에서 iloc로 views가 세번째로 큰 도시를 출력해내는데 실제 시험에서는 정답만 기입하면 되는데 혹시 iloc로 구하지않고 육안으로 답을 알아보면 굳이 저렇게 까지 진행하지 않아도 될까요? 아니면 출력하는 마지막 코드까지 완성을 해둬야 하는걸까요?
미해결
[개정판] 파이썬 머신러닝 완벽 가이드
안녕하세요 사이킷런을 이용한 GMM 군집화 실습 강의 중 질문입니다. 9:15 에서 transformation = [[0.60834549,-0.63667341],[-0.40887717,0.85253229]] 로 설정하면 된다고 하셨는데 이 값들은 어디서 도출된 값인가요? 이 부분은 자세한 설명 없이 바로 다음 부분으로 넘어가시는데요, 이 값들이 어떻게 도출된 값들인지 자세한 설명 부탁드립니다
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
test_id=test['id'] test = test.drop(['id'],axis=1) 이렇게 해도 괜찮나요??
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
결과가 이런식으로 나오면 성공한건가요?? 추가로 id컬럼 정렬이나 y_test 비교 roc 점수가 88%면 합격일지도 궁금합니다 ㅠ
해결됨
38군데 합격 비법, 2026 코딩테스트 필수 알고리즘
안녕하세요! '4-5 그래프' 강의 내용 중에 '인접 리스트'를 사용해 그래프를 표현하는 경우 공간복잡도가 최악의 경우에도 O(N)이라고 설명을 해주셨는데요! 그래프의 모든 노드가 다른 모든 노드에 연결되어있는 경우라면 딕셔너리 안에 N개의 키와 각각의 키에 크기 N-1의 1차원 배열이 들어가게 되니, 결국 N*(N-1) 만큼이 공간을 차지하여 최악의 경우 2차원 배열과 동일하게 O(N^2)의 공간복잡도를 가지게 되는 것은 아닌가 하는 생각이 들었는데요, 인접 리스트를 사용할 때 최악의 경우 어떻게 O(N)의 공간복잡도가 나오게 되는지 궁금합니다! 그리고, 일반적인 경우에는 모든 노드가 연결되어 있지는 않겠지만, 항상 이러한 최악의 경우도 고려하면서 문제를 풀어야 할지도 궁금합니다!
해결됨
챗GPT와 파이썬으로 주식 자동매매 앱 및 웹 투자 리포트 만들기
파이썬 32비트 가상환경으로 설치한다는게 정확히 어떤 의미인가요? 이미 아나콘다가 설치되어 있는 경우는 파이썬을 다운그레이드 하는걸까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 선생님 연습을 하는데 코랩에서 코드가 자동으로 입력되서 연습하는데 방해가 되는거같아서요ㅜㅜ 도구 -> 편집기 -> 컨텍스트 기반 코드 완성 표기 체크를 껐는데도 코드가 생길때는 어떻게 해야하나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
마지막 강의 영상 <정리>부분에서 데이터 불러오기 X_train = pd.read _csv(" https://raw.githubusercontent.com/lovedlim/inf/main/p2/data_atype/X_train.csv ") y_train = pd.read _csv(" https://raw.githubusercontent.com/lovedlim/inf/main/p2/data_atype/y_train.csv ") X_test = pd.read _csv(" https://raw.githubusercontent.com/lovedlim/inf/main/p2/data_atype/X_test.csv ") 데이터 분리 n_train = X_ train.select _dtypes(exclude='object').copy() n_test = X_ test.select _dtypes(exclude='object').copy() c_train = X_ train.select _dtypes(include='object').copy() c_test = X_ test.select _dtypes(include='object').copy() 수치형 민맥스 스케일 cols = ['age', 'fnlwgt', 'education.num', 'capital.gain', 'capital.loss', 'hours.per.week'] from sklearn.preprocessing import MinMaxScaler scaler = MinMaxScaler() n_train[cols] = scaler.fit _transform(n_train[cols]) n_test[cols] = scaler.transform(n_test[cols]) 라벨인코딩 cols = ['workclass', 'education', 'marital.status', 'occupation', 'relationship', 'race', 'sex', ' native.country '] from sklearn.preprocessing import LabelEncoder le = LabelEncoder() for col in cols: le = LabelEncoder() c_train[col] = le.fit _transform(c_train[col]) c_test[col] = le.transform(c_test[col]) 이 부분에서 이러한 에러가 납니다.. --------------------------------------------------------------------------- TypeError Traceback (most recent call last) ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in _encode(values, uniques, encode, check_unknown) 112 try: --> 113 res = _encode_python(values, uniques, encode) 114 except TypeError: ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in _encode_python(values, uniques, encode) 60 if uniques is None: ---> 61 uniques = sorted(set(values)) 62 uniques = np.array(uniques, dtype=values.dtype) TypeError: '<' not supported between instances of 'str' and 'float' During handling of the above exception, another exception occurred: TypeError Traceback (most recent call last) <ipython-input-95-295cc9604042> in <module> 7 for col in cols: 8 le = LabelEncoder() ----> 9 c_train[col] = le.fit_transform(c_train[col]) 10 c_test[col] = le.transform(c_test[col]) ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in fit_transform(self, y) 254 """ 255 y = column_or_1d(y, warn=True) --> 256 self.classes_, y = _encode(y, encode=True) 257 return y 258 ~\anaconda3\lib\site-packages\sklearn\preprocessing\_label.py in _encode(values, uniques, encode, check_unknown) 115 types = sorted(t.__qualname__ 116 for t in set(type(v) for v in values)) --> 117 raise TypeError("Encoders require their input to be uniformly " 118 f"strings or numbers. Got {types}") 119 return res TypeError: Encoders require their input to be uniformly strings or numbers. Got ['float', 'str']
해결됨
직장인에게 꼭 필요한 파이썬-아래아한글 자동화 레시피
일코님 안녕하세요. 한글에서 메타 태그를 활용해 보려고 합니다. 문서 정보에서 태그 넣기 자동화 할 수 있는 방법이 있을까요?
미해결
Practical Testing: 실용적인 테스트 가이드
OrderControllerDocsTest.java @DisplayName("주문 생성 API") @Test void createOrder() throws Exception { OrderCreateRequest request = OrderCreateRequest.builder() .productNumbers(List.of("001")) .build(); LocalDateTime now = LocalDateTime.now(); given(orderService.createOrder(any(OrderCreateServiceRequest.class), any(LocalDateTime.class))) .willReturn(OrderResponse.builder() .id(1L) .totalPrice(4000) .registeredDateTime(now) .products(List.of(ProductResponse.builder() .id(1L) .productNumber("001") .type(ProductType.HANDMADE) .sellingStatus(ProductSellingStatus.SELLING) .name("아메리카노") .price(4000) .build())) .build()); mockMvc.perform(post("/api/v1/orders/new") .contentType(MediaType.APPLICATION_JSON) .content(objectMapper.writeValueAsString(request))) .andDo(print()) .andExpect(status().isOk()) .andExpect(jsonPath("$.code").value("200")) .andExpect(jsonPath("$.message").value("OK")) .andExpect(jsonPath("$.status").value("OK")) .andDo(document("order-create", preprocessRequest(prettyPrint()), preprocessResponse(prettyPrint()), requestFields( fieldWithPath("productNumbers").type(JsonFieldType.ARRAY) .description("상품 번호") ), responseFields( fieldWithPath("code").type(JsonFieldType.NUMBER) .description("코드"), fieldWithPath("status").type(JsonFieldType.STRING) .description("상태"), fieldWithPath("message").type(JsonFieldType.STRING) .description("메시지"), fieldWithPath("data").type(JsonFieldType.OBJECT) .description("응답 데이터"), fieldWithPath("data.id").type(JsonFieldType.NUMBER) .description("주문 ID"), fieldWithPath("data.totalPrice").type(JsonFieldType.NUMBER) .description("주문 총 금액"), fieldWithPath("data.registeredDateTime").type(JsonFieldType.ARRAY) .description("주문 시각"), fieldWithPath("data.products").type(JsonFieldType.ARRAY) .description("주문 상품"), fieldWithPath("data.products[].id").type(JsonFieldType.NUMBER) .description("상품 ID"), fieldWithPath("data.products[].productNumber").type(JsonFieldType.STRING) .description("상품 번호"), fieldWithPath("data.products[].type").type(JsonFieldType.STRING) .description("상품 타입"), fieldWithPath("data.products[].sellingStatus").type(JsonFieldType.STRING) .description("상품 상태"), fieldWithPath("data.products[].name").type(JsonFieldType.STRING) .description("상품 이름"), fieldWithPath("data.products[].price").type(JsonFieldType.NUMBER) .description("상품 가격") ))); } docs/index.html 에서 확인한 registeredDateTime 처음에 테스트 코드 작성시에 ieldWithPath("data.registeredDateTime").type(JsonFieldType.ARRAY) .description("주문 시각"), 이 부분을 JsontFieldType.STRING 으로 했더니 테스트 실패 메시지에 해당 타입이 Array 라고 해서 바꿨는데... 문서에 저렇게 나옵니다. 이게 맞는건지 궁금합니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
노트북 빈칸으로 먼저 문제를 풀이하는 중에 결측값 처리를 행을 삭제하는 방식으로 처리하였습니다. 맨 마지막 y_test와 r2계수를 구하는 과정에서 삭제된 행만큼의 데이터가 맞지 않아 오류가 났는데 실제 실기 시험에서도 결측치가 있는 행을 삭제하면 안되는 것인가요?? 결측치는 반드시 다른 값으로 대체 해야 하는 것 인가요?