안녕하세요 딩코님! 좋은 강의 잘 들었습니다. 강의를 듣다가 조언을 구하고 싶은게 있어서 질문 남깁니다. 저는 현재 주니어 개발자로 일으나 부하테스트 같은것을 회사에서 해볼 수 없는 상황이라(운영 인력이 아님...또한 작은 시스템이라 모니터링도 없고 구축할수도 없는 환경)강의에서 다뤄주신 내용을 실무에 적용해보기가 어려운데요... 그래서 제가 생각해본게 테스트 코드로 만들어서 돌려보면 어떨까 생각했거든요. 예를들어 아래와 같은 메소드를 만들어 놓고, 캐시 전/후를 비교하는 거죠... long start = System.currentTimeMillis(); service.findSomething(id); long elapsed = System.currentTimeMillis() - start; System.out.println(elapsed); 그런데 한가지 고민되는 포인트가, 테스트 코드로 만들어서 돌렸을때 성능 개선을 수치적으로 적기가 좀 애매할것 같다고 생각이 들어서요. 아무래도 JVM이라던지, warmup이라던지 통제할 수 없는 변수가 있다보니까요. 그래서 질문은 아래와 같습니다. 특정 메소드에 로컬 캐시를 적용하기 전/후 테스트 코드에서 성능을 비교 했을때, 1초->1ms로 성능 개선했다. <- 이런 문장이 임팩트가 있을까요? 아님 테스트 코드에서 한건 좀 신뢰성이 떨어질까요? ㅠㅠ 테스트 코드에서 돌려봤을때 누가봐도 신뢰성있게 만들려면 어떻게(?), 무슨 툴(?)을 써서 하는게 좋을까요? ㅠㅠ 저 같이 운영 환경에 적용해볼수 없는 개발자에게 조언을 주시면 또 감사하겠습니다!
13 섹션 병렬 스트림을 퀵하게 필요하여 고급1탄( 김영한의 실전 자바 - 고급 1편, 멀티스레드와 동시성) 어느 섹션을 순차적으로 보아야 할까요? 물론 유기성으로 섹션1부터 모두 보면 좋겠지만 당장 써먹어야 하여 진도를 나갈 수 있는 수준의 섹션만 우선 보고 적용후 추후 다시 보려 합니다
수고하십니다.^^ 12회 빅분기 시험을 보고 왔는데, 통과 되는 선까지는 풀었는데,... 문제는 정답을 푼 문제별로 제출버튼을 클릭은 했는데, 풀 수 있을거 같은 문제가 하나 있어서 그걸 가지고 끝까지 씨름을 하다가 시험 종료가 돼서 자동으로 아웃이 됐는데... 최종버튼이 있었던거 같기도 하고... 각 문제별로 제출버튼을 클릭하면 제출된건가요?
안녕하세요~ 강의 덕분에 시험 잘 본 것 같습니다 작업 유형 2에서 train 타켓컬럼.describe 에서 이상치가 있는 것 같아서 iqr로 해서 이상치 대략 410개정도(전체 train 데이터 5000개) 제거하고 lgb랑 랜덤포레스트로 돌렸더니 rmse lgb 기준 71정도 나와서 제출했는데 생각해보니 과적합 위험이 클 것 같아서 점수 괜찮게 나올까요? 이상치 제거 안하고 그냥 onehot 인코딩으로 해서 했을때는 410 정도 나왔습니다ㅠㅠ
안녕하세요, 코딩팡 장업형2 베이스 라인에서 원-핫 인코딩만 사용하셨는데 인코딩 부분에 아래와 같이 추가해서 레이블 인코딩과 원-핫 인코딩 결과를 비교하는 식으로 해도 상관없나요? 원핫 인코딩만 사용하신 이유가 있을까요?? 1번 문제 import pandas as pd # 1) 데이터 불러오기 train = pd.read_csv('data/car_train.csv') test = pd.read_csv('data/car_test.csv') # 2) 범주형 변수 원-핫 인코딩 target = train.pop('target') print(train.shape, test.shape) train = pd.get_dummies(train) test = pd.get_dummies(test) print(train.shape, test.shape) # 레이블 인코딩 from sklearn.preprocessing import LabelEncoder cols = train.select_dtypes(include = 'object').columns for col in cols: le = LabelEncoder() train[col] = le.fit_transform(train[col]) test[col] = le.transform(test[col]) # 3) 검증용 분리 (제출 전 성능 비교) from sklearn.model_selection import train_test_split X_tr, X_val, y_tr, y_val = train_test_split(train, target, test_size=0.2, random_state=0, stratify=target) # 4) 세 가지 모델 학습 from sklearn.ensemble import RandomForestClassifier rf = RandomForestClassifier(random_state=0) rf.fit(X_tr, y_tr) pred = rf.predict(X_val) from sklearn.metrics import f1_score print(f1_score(y_val, pred, average='macro')) from lightgbm import LGBMClassifier lgb = LGBMClassifier(random_state=0, verbose=-1) lgb.fit(X_tr, y_tr) pred = lgb.predict(X_val) print(f1_score(y_val, pred, average='macro')) from xgboost import XGBClassifier xgb = XGBClassifier(random_state=0, verbosity=0) xgb.fit(X_tr, y_tr) pred = xgb.predict(X_val) print(f1_score(y_val, pred, average='macro')) # 5) 선택한 모델을 전체 train으로 다시 학습 후 test 예측 (선택) # lgb.fit(train, target) # pred = lgb.predict(test) # 6) 제출 파일 저장 (pred 컬럼 1개만, index 제거) result = pd.DataFrame({'pred': pred}) result.to_csv('result.csv', index=False) # 제출파일 확인 print("\n ===== 제출파일 (샘플) =====") print(pd.read_csv("result.csv").head()) print("\n ===== 제출파일 (크기 확인) =====") print(pd.read_csv("result.csv").shape)
안녕하세요 강사님! 강의 잘 듣고 있습니다. 다차원 배열이랑 가변 배열 파트를 복습하다가 인덱스 해석 순서랑 반복문 매칭이 헷갈리는 부분이 생겨서 질문 남깁니다. 강의에서 3차원 배열을 순회할 때 가장 안쪽 루프가 '높이'에 해당한다고 설명해 주셨는데, 제가 직접 코드를 짜서 출력해 보니까 조금 헷갈리는 부분이 있습니다. 제가 테스트해 본 전체 코드는 다음과 같습니다. public class ArrayTest { public static void main(String[] args) { int[][][] sheet = new int[2][3][4]; int count = 1; for (int i = 0; i < sheet.length; i++) { for (int j = 0; j < sheet[i].length; j++) { for (int k = 0; k < sheet[i][j].length; k++) { sheet[i][j][k] = count++; } } } for (int i = 0; i < sheet.length; i++) { System.out.println("=== [시트 " + i + "] ==="); for (int j = 0; j < sheet[i].length; j++) { for (int k = 0; k < sheet[i][j].length; k++) { System.out.print(sheet[i][j][k] + "\t"); } System.out.println(); } System.out.println(); } } } 이 코드를 실행해 보면 가장 안쪽 루프인 k가 돌 때 숫자가 위로 쌓이는 게 아니라, 왼쪽에서 오른쪽으로 평평하게 가로 줄(열)을 그리면서 출력이 되더라고요. 그리고 가장 바깥쪽 루프인 i가 바뀔 때 시트가 전환되는 것을 확인했습니다. 특히 같이 알려주신 가변 배열(Jagged Array) 개념을 여기에 대입해 보니까 더 헷갈리는데요. 자바는 new int[2][][]; 처럼 각 행마다 열의 크기를 다르게 지정할 수 있는 구조인데, 행마다 방 개수가 제각각인 상황에서 가장 안쪽 루프를 '높이'라고 생각하면 가변 배열의 형태가 머릿속으로 잘 매칭이 안 되어서요. 자바 메모리 구조상 공간적인 높이라는 비유보단, 엑셀로 따지면 처음 게 시트고 두 번째가 행, 마지막이 열이라고 생각하는 게 코드상으로나 가변 배열 구조상으로나 더 자연스러워 보이는데 제가 놓친 디테일이 있을까요? 제가 자바의 다차원 배열 메커니즘을 오해하고 있는 부분이 있는 건지, 아니면 세로-가로-높이 비유를 코드에 대입할 때 제가 놓친 디테일이 있는지 궁금합니다. 확인해 주시면 감사하겠습니다!
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 기출 풀어보면 C를 안 붙이고, object도 자연스럽게 변환된다고 하셨는데, 연습할 때 gender에 C를 붙였던 경험이 있습니다. 혹시 언제 붙이고 언제 안 붙이는지 알 수 있을까욤..?
빅데이터분석기사 실기체험에서 작업형 제2유형을 회귀 실습해보고 있는데. 에러가 나는데 이유를 전혀모르겠어요. import pandas as pd train = pd.read _csv("data/customer_train.csv") test = pd.read _csv("data/customer_test.csv") target = train.pop('총구매액') train = pd.get_dummies(train) test = pd.get_dummies(test) from sklearn.ensemble import RandomForestRegressor model = RandomForestRegressor() model.fit (train, target) p = model.predict(test) submit = pd.DataFrame({'pred':p}) submit.to _csv("result.csv", index=False) print(submit.head()) 에러) Makefile:6: recipe for target 'py3_run' failed make: *** [py3_run] Error 1 Traceback (most recent call last): File "/goorm/Main.out", line 38, in <module> p = model.predict(test) ^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.12/site-packages/sklearn/ensemble/_ forest.py ", line 1063, in predict X = self._validate_X_predict(X) ^^^^^^^^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.12/site-packages/sklearn/ensemble/_ forest.py ", line 641, in validate X_predict X = self._validate_data( ^^^^^^^^^^^^^^^^^^^^ File "/usr/local/lib/python3.12/site-packages/sklearn/ base.py ", line 608, in validate data self._check_feature_names(X, reset=reset) File "/usr/local/lib/python3.12/site-packages/sklearn/ base.py ", line 535, in check feature_names raise ValueError(message) ValueError: The feature names should match those that were passed during fit. Feature names seen at fit time, yet now missing: - 주구매상품_소형가전
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 실기시험 응시 가이드를 보면 제2유형은 pred 컬럼 하나만 생성한다고 적혀있는데, 이러면 다중분류의 roc-auc 문제는 나올 확률이 거의 없다고 봐도 될까요?