작업형1 모의고사 물어보기
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형1 모의고사 풀어보기 강의에서 코드 제출 버튼을 누르셨지만 실제로는 답안에 출력값만 적는 것이 맞는 건가요? (예를 틀어 첫 번째 문제는 답안에 1115만 쓰면 되는 것)
- python
- 머신러닝
- 빅데이터
- pandas
- 빅데이터분석기사
172만명의 커뮤니티!! 함께 토론해봐요.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
작업형1 모의고사 풀어보기 강의에서 코드 제출 버튼을 누르셨지만 실제로는 답안에 출력값만 적는 것이 맞는 건가요? (예를 틀어 첫 번째 문제는 답안에 1115만 쓰면 되는 것)
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
dir help 쓰면 된다는데 이게무슨말인가요?? 지금 74강정도인데 강의서는 이런거 못들어서요
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
문제 1-3에서 ' 문제1-2에서 적합한 회귀모형을 이용하여 test데이터에서 design값을 산출한 후 ...라고 되어있습니다. model = ols ( "design ~ c1+c2+c4" , data=test ) .fit () 문제 1-2에서 이렇게 적합된 모델을 먼저 불러오고 test [ 'pred_design' ] =model.predict ( test ) 테스트 예측값 산출 식 작성하면 안되나요~? 문제에서 1-2에서 적합한 모형 이용이라는 문구가 있어서 헷갈립니다~! ㅠㅠ 이렇게 풀었을때는 8.17이 정답으로 나옵니당..
미해결
[EduAtoZ] Python CosPro 1급 예상문제 풀이(40문제)
지금(2025.11.21) 기준으로 샘플 문제가 한 회차밖에 제공되지 않습니다. 최신 샘플 문제들을 더 받아볼 수 있는 방법이 있을까요? YBM 말고 다른 소스라도 괜찮습니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요 강사님! 좋은 강의에 감사드립니다. 다름이 아니라 코랩에서는 가끔 df로 받는 연산함수같은 경우, 다시 한번 눌렀을 때 결과가 계속 달라지는 경우가 있더라구요. (예시) df = len(df) * 0.7 등 하면 점점 df가 줄어든다던지.. 그래서 코랩에서는 다시 클릭하기보다, 다음 +코드로 넘어가서 작성을 하는데요. 시험 환경에서는 무조건 첫줄부터 새로 시작인가요? 중간 과정 확인하다가 연산이 두번 되어서 값이 바뀔까봐 염려되네요 ㅠㅠ
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
안녕하세요 강사님! 좋은 강의에 감사드립니다. 다름이 아니라, 3회 기출문제(작업형2)에서 아래와 같이 robust scaler를 사용하실 때 train과 test를 각각 스케일링하는 거랑 data = pd.concat[train, test]로 합치는 것과 실전에서 영향이 없을까요? train 범위 표본을 가지고 fit 한 경우와 concat한 큰 data를 가지고 fit 한 경우가 스케일링 결과가 다른 경우가 있을까요? n_train[cols] = scaler.fit_transform(n_train[cols]) n_test[cols] = scaler.transform(n_test[cols])
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
빅이시 단기준비자 또는 복습용 코랩 링크는 따로 안올려주시나요?
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
캐글에 올려주신 연습문제를 풀어보려고 합니다. 시험처럼 통으로 된 부분을 새로 풀어보고 싶은데 가려지지도 않고 코랩으로 데이터를 불러오려고 해도 불러지지 않네요. 방법이 있을까요?? 미리 감사드립니다!
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
9회 작업형 3유형 1번문제에서 train, test로 데이터를 분리시키는 이유가 무엇인가요? 어떤 경우에 나눠서 진행해야 하는지 궁금합니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 train = train.drop("ID", axis=1) train.head(1)
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
강사님은 a로 작업하셨는데 df로 작업해도 문제가 없는건가요? df로 했을 때 답이 나오긴 했는데 실제 시험장에서도 문제가 없을지 궁금합니다.
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
4회 기출 작업형2에서 해설처럼 # test데이터 ID 복사 test_ID = test.pop('ID') test_ID test_ID를 따로 분리하지 않고 아래처럼 test['ID'] 이렇게 작성해도 같은 결과값이 나올까요? pred = model.predict(test) result = pd.DataFrame({'ID' : test['ID'] , 'Segmentation' : pred }) result.to_csv('result.csv', index = False) print(pd.read_csv('result.csv'))
미해결
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 작업형2번 문제 전처리 부분을 원핫인코딩한다면 어떤 코딩으로 써야하나요? 답변부탁드립니다. 원핫으로만 하려고하는데 다양하게 알려주셔서 더 헷갈려서요..
미해결
토비의 클린 스프링 - 도메인 모델 패턴과 헥사고날 아키텍처 Part 1
안녕하세요 . 강의에서 애그리거트 루트가 하위 도메인을 일관성을 유지하기 위해 member.updateInfo() 로 MemberDetail updateinfo() 를 호출하는것을 보았는데요 만약 Profille에 여러 속성(프로필주소, 프로필이미지를 불러올 수 있는 주소,정보 등이 존재)이 있어 값 타입이 아닌 Entity로 존재해야 할 경우엔 member.updateInfo() -> memberDetail.updateInfo() -> profile.updateInfo() 로 depth가 내려갈 것 같은데요. 뭔가 잘못된 방법 같아서요.. 혹시 이런 경우에는 어떻게 도메인을 설계해야 좋을지 궁금합니다...!!
해결됨
머신러닝, 핵심만 빠르게!
section2는 언제 upload 하나요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
올라와있는 시험환경 체험링크의 문제 내용이랑 강의내용에 있는 문제 내용이랑 다른데 어떻게 해야 하나요? csv 파일도 다릅니다. 그리고 구글 코랩에 올라와있는 링크도 404 에러가 뜨네요
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
학습 관련 질문을 남겨주세요. 상세히 작성하면 더 좋아요! 질문과 관련된 영상 위치를 알려주면 더 빠르게 답변할 수 있어요 먼저 유사한 질문이 있었는지 검색해보세요 cond1 = df['구분'] = '발생건수' cond2 = df['구분'] = '검거건수' df1 = df[cond1] df2 = df[cond2] df2 이렇게 입력했는데 --------------------------------------------------------------------------- KeyError Traceback (most recent call last) /usr/local/lib/python3.12/dist-packages/pandas/core/indexes/base.py in get_loc(self, key) 3804 try: -> 3805 return self._engine.get_loc(casted_key) 3806 except KeyError as err: index.pyx in pandas._libs.index.IndexEngine.get_loc() index.pyx in pandas._libs.index.IndexEngine.get_loc() pandas/_libs/hashtable_class_helper.pxi in pandas._libs.hashtable.PyObjectHashTable.get_item() pandas/_libs/hashtable_class_helper.pxi in pandas._libs.hashtable.PyObjectHashTable.get_item() KeyError: '발생건수' The above exception was the direct cause of the following exception: KeyError Traceback (most recent call last) 2 frames /usr/local/lib/python3.12/dist-packages/pandas/core/indexes/base.py in get_loc(self, key) 3810 ): 3811 raise InvalidIndexError(key) -> 3812 raise KeyError(key) from err 3813 except TypeError: 3814 # If we have a listlike key, _check_indexing_error will raise KeyError: '발생건수' 왜 발생건수에 대한 오류가 뜨는거죠? 정말 샅샅히 오류를 찾아봤는데 선생님이 하신거랑 똑같이한거같은데 ㅠㅠ
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
문제에서 만약 pvalue나 회귀계수에서 가장 작은 변수를 구하라고 하면 절댓값 기준으로 구하는게 맞을까요?
해결됨
[퇴근후딴짓] 빅데이터 분석기사 실기 (작업형1,2,3)
선생님 안녕하세요. 여러 모델을 외우기 힘들면 랜덤포레스트 하나로 가도 된다고 말씀해주셨는데, 그렇게하면 평가(RMSE, ...)를 하는게 의미가 없다고 생각하는데요. 평가자체를 하지 않고 랜덤포레스트 모델로 학습시켜 바로 예측하여 제출해도 문제가 없는걸까요? 그리고, 연습문제 저 혼자 풀어보고 선생님 파일이랑 대략 비교해보고싶은데, 어떻게 비교 또는 확인해볼 수 있을까요?
미해결
실전 jOOQ! Type Safe SQL with Java
안녕하세요 공부하다가 보니 FetchGroups방식으로 했을때 Map으로 반환되고 DTO로 변환해야하는 오버헤드가 발생하는데요 Multiset방식으로 하면 1:N 관계에서 바로 DTO로 반환 할 수 있는데요 코드 보기가 조금은 더 복잡해 보이지만 WHERE절이 있을때 현재 테이블 데이터와 인덱스 상으로는 성능적으로 더 괜찮은거 같아서 multiset방식은 강의에 없어서 어떤지 궁금해서 여쭤봅니다 public List<ActorFilmography> findActorFilmographyWithMultiset(ActorFilmographySearchOption searchOption) { final JFilmActor FILM_ACTOR = JFilmActor.FILM_ACTOR; final JFilm FILM = JFilm.FILM; return dslContext.select( ACTOR, DSL.multiset( DSL.select(FILM.fields()) .from(FILM) .join(FILM_ACTOR) .on(FILM.FILM_ID.eq(FILM_ACTOR.FILM_ID)) .where( FILM_ACTOR.ACTOR_ID.eq(ACTOR.ACTOR_ID), containsIfNotBlank(FILM.TITLE, searchOption.getFilmTitle()) ) ).convertFrom(r -> r.into(Film.class)) ) .from(ACTOR) .where( containsIfNotBlank(ACTOR.FIRST_NAME.concat(" ").concat(ACTOR.LAST_NAME), searchOption.getActorName()) ) .fetch(record -> new ActorFilmography( record.value1().into(Actor.class), record.value2() )); } WHERE 조건 포함 시 성능 비교 fetchGroups 방식 (cost=405, rows=609) Film 필터링 먼저 → FilmActor 조인 → Actor 필터링 1. film 테이블 스캔 (1000 rows) └─ LIKE '%COMMANDMENTS EXPRESS%' → 111 rows 2. film_actor 인덱스 조회 (idx_fk_film_id) → 609 rows 3. actor PRIMARY KEY 조회 → 609 rows └─ LIKE '%LOLLOBRIGIDA%' → 1 row (최종) 특징: - Film 조건이 선택적이면 먼저 필터링하여 조인 범위 축소 - 하지만 Actor 필터링은 마지막에 수행 (비효율) - 609개 row가 네트워크 전송 → 애플리케이션에서 1개로 그룹핑 --- multiset 방식 (cost=20.2 + 13.3 × filtered_actors) Actor 필터링 먼저 → 각 Actor의 Film 서브쿼리 1. actor 테이블 스캔 (200 rows) └─ LIKE '%LOLLOBRIGIDA%' → 1 row (필터링 후) 2. 필터링된 1개 actor에 대해 서브쿼리 실행: - film_actor PRIMARY KEY 조회 (27.3 rows 추정) - film PRIMARY KEY 조회 (27.3번) - LIKE '%COMMANDMENTS EXPRESS%' → 1개 매칭 특징: - Actor 조건을 먼저 적용하여 서브쿼리 실행 횟수 최소화 - 필터링된 1개 Actor만 네트워크 전송 (JSON 포함) - Film 필터링은 각 actor 서브쿼리 내부에서 수행 --- 실제 Total Cost 계산 fetchGroups Total: 405 네트워크 전송: 609 rows (Actor + Film 중복 포함) 애플리케이션 처리: Map 생성 + Stream 변환 multiset Total: 20.2 + (13.3 × 1) = 33.5 네트워크 전송: 1 row (Actor + JSON array) 애플리케이션 처리: JSON 역직렬화 결론: WHERE 조건이 있으면 multiset이 압도적으로 유리 (405 vs 33.5) FetchGroups는 Actor를 나중에 필터링하고 multiset은 actor를 먼저 필터링해서 1개에 대한 film을 여러개 가져와서 현재 데이터에서는 더 유리한데 일반적인 사용법이 궁금합니다