Component 수는 어떻게 지정을 해야 할까요?
미해결
모두의 한국어 텍스트 분석과 자연어처리 with 파이썬
LDA나 NMF 에서 component 수를 어떤 것을 참고해서 최적의 수를 찾을 수 있을까요? 군집에서 엘보우플롯이나, 실루엣 스코어를 참고했는데, 혹시 이렇게 참고할 만한 것이 있을까 궁금합니다.
- python
- 머신러닝
- 빅데이터
- NLP
- 텍스트마이닝
- lda
- component
172만명의 커뮤니티!! 함께 토론해봐요.
미해결
모두의 한국어 텍스트 분석과 자연어처리 with 파이썬
LDA나 NMF 에서 component 수를 어떤 것을 참고해서 최적의 수를 찾을 수 있을까요? 군집에서 엘보우플롯이나, 실루엣 스코어를 참고했는데, 혹시 이렇게 참고할 만한 것이 있을까 궁금합니다.
해결됨
김영한의 실전 데이터베이스 - 설계 1편, 현대적 데이터 모델링 완전 정복
A, B, C 이렇게 세 개의 테이블이 있는데요, A → B, B → C, C → A 이렇게 서로 참조하고 있는 구조입니다. 문제는 이렇게 되어 있으니까, 예를 들어 B를 지우려면 A가 걸리고, A를 지우려면 또 C가 걸리고, C를 지우려면 다시 A가 걸려서 결국 서로 물려서 삭제가 안 되는 상황이 생깁니다. 예를 들면 A = 학생(Student) → 어떤 수업(B) 에 참여하고, B = 수업(Class) → 그 수업은 교사(C) 가 담당하며, C = 교사(Teacher) → 교사는 자신이 가르치는 학생(A) 들의 리스트를 참조(관리용). 이 예시는 정확한 상황은 아니고 제가 생각해서 만들어낸 예시입니다 조금 안맞을수 있는데 만약에 이런 경우에 보통 어떻게 처리해야하나요?
미해결
코딩 테스트 합격자 되기 - 파이썬 편
안녕하세요. 강의에서 딕셔너리로 표현한다는 부분이 {1: 1, 2: 2, 3: 3, 4: 99999999} 이렇게 하나의 배열대신 하나의 딕셔너리로 표현한다는 의미가 맞을까요? 감사합니다.
미해결
김영한의 실전 데이터베이스 - 설계 1편, 현대적 데이터 모델링 완전 정복
어떻게 보면 이 수업과는 조금은 먼 이야기일수도 있는데 실제 프로젝트에서 JPA를 다루다보니 엔티티 선언시에 시간 타입 정의를 어떻게 처리해야 할지가 항상 고민이 되더라구요. 현재 프로젝트에서는 Entity 정의시에는 Instant를 사용을 하는데, 혹시 추천하시는 방법이 있을까요??
미해결
파이썬 동시성 프로그래밍 : 데이터 수집부터 웹 개발까지 (feat. FastAPI, async, await)
asyncio.gather() 를 사용해 여러 요청을 동시에 처리하는데, 실제 프로덕션 환경에서는 어떻게 다루는지 궁금합니다. 예를 들어, 페이지를 1,000개 크롤링하거나 이미지를 수천 장 다운로드할 때 서버에 부하가 생기거나 IP 차단 같은 문제가 발생할 것 같습니다. 해결 방법으로 동시 요청 수를 제한하는 게 좋을까요? 만약 그렇다면 적절한 동시성 수준(5개? 10개? 50개?)은 어떤 기준으로 결정하나요?
미해결
김영한의 실전 데이터베이스 - 기본편
풀 외부 조인을 잘 사용하지는 않지만 가끔 사용하실 때가 있다고 했는데 어떨 때 사용하셨는지 궁금합니다.
해결됨
회사에서 바로 쓰는 업무자동화 AI 에이전트 (w. n8n, LangGraph)
현업에서 보통 n8n 워크플로우를 Python 노드로 어느 정도 수준까지 전처리를 진행하나요? Python 환경과 n8n 환경을 sync를 맞춰서 연동하는 좋은 꿀팁 혹은 구조가 있는지 궁금합니다.
미해결
JPA (ORM) 개발자를 위한 고성능 SQL (High-Performance SQL)
안녕하세요, 강의 잘 듣고 있습니다. 좋은 강의 만들어주셔서 감사합니다! 강의에서 JSON 타입을 활용하는 부분이 인상 깊어서, 이를 실무 API 배치 작업에도 적용할 수 있겠다고 생각했습니다. 현재는 API 호출 비용 절감을 위해 응답 데이터를 저장하고 있습니다. 그런데 외부 API는 언제든 스펙이 변경될 수 있어서, '원본 응답을 그냥 JSON 형태 그대로 저장하는 게 낫지 않을까'라는 생각이 들었습니다. 다만 저희는 MySQL을 사용하고 있어서, PostgreSQL의 Materialized View 같은 기능을 직접 활용할 수 없습니다. 대신 MySQL에서 JSON 컬럼을 효율적으로 활용하면서도 백오피스 조회 성능을 보장할 수 있는 방법이 궁금합니다. 예를 들어, JSON 컬럼에 데이터를 저장하면서, 자주 조회하는 필드는 생성 컬럼을 두고 인덱스를 적용하는 방식이 일반적인지, 아니면 JSON은 단순 보존용으로만 두고, 정규화된 별도 테이블을 함께 운영하는 것이 나은지, 또는 다른 고성능 패턴이 있는지 궁금합니다.
미해결
김영한의 실전 데이터베이스 - 설계 1편, 현대적 데이터 모델링 완전 정복
실무에서도 외래 키(Foreign Key)를 쓸수 있는 상황이지만 특별히 쓰지않고 처리하는 경우가 있을까요? 예를 들어 시스템 초기에 보다 유연한 설계를 위해? 데이터 보전을 위해? 아니면 쓸수 있으면 최대한 쓰는게 맞을까요?
해결됨
김영한의 실전 데이터베이스 - 설계 1편, 현대적 데이터 모델링 완전 정복
안녕하세요. 섹션 8에서 장바구니에 주문을 생성할 때 같은 상품이 중복으로 생성되게 하지 않게 제약 조건을 걸었는데 실무에서는 쿼리에서 제약 조건을 거는 지 아니면 애플리케이션에서 - 없을 때 추가 - 있을 경우 수량 증가 와 같이 아니면 비즈니스 로직에서만 처리 하는 지 어떤 케이스나 어느 비율로 적용하는 사례가 궁금합니다.
해결됨
BigQuery(SQL) 활용편(퍼널 분석, 리텐션 분석)
안녕하세요 데이터분석가로 근무하고 있는 수강생입니다. array 등과 같은 기능이 저는 다소 생소한데 자주 쓰는 문법인지 궁금합니다ㅣ
해결됨
확률과 통계 101
표본의 분위수를 구하는 방법에 대한 설명이 조금 헷갈렸습니다. 데이터를 오름차순으로 정렬하고, 'α 분위수는 α * 100% 위치의 값이다'라고 하셨는데, '위치'가 단순히 데이터의 개수로 따져서 n * α 를 가리키는 건지, 아니면 데이터 범위 안에서 {x_(n) - x_(1)} * α + x_(1) 에 가까운 값의 sub index를 찾고자 하는 건지 혼동됩니다.
미해결
김영한의 실전 데이터베이스 - 기본편
database mysql을 사용하다가 질문드립니다 create index idx_items_stock_quantity on items(stock_quantity); 이렇게 인덱스를 생성하고 order by를 다음과 같이 stock_quantity를 기준으로 한다면, explain select * from items order by stock_quantity; 이렇게 실행계획을 보면 이 쿼리의 type이 적어도 ALL로 나오진 않을거라고 생각했습니다. 그냥 인덱스를 stock_quantity를 기준으로 생성하면 알아서 정렬이 되어 있을 거니까요. 그런데, 실제로 확인해보니까 type이 ALL로 나옵니다. 왜 그런걸까요? (by Claude Sonnet 4.5) select * 의 경우 1. stock_quantity 인덱스를 활용한 랜덤 I/O를 하는 경우 2. 테이블을 순차적으로 쭉 읽는 순차 I/O를 하는 경우 이 두 경우 중 옵티마이저가 2번째 방법을 활용해서 그렇다고 합니다. 그냥 이렇게 알고 있으면 될까요?
미해결
김영한의 실전 데이터베이스 - 설계 1편, 현대적 데이터 모델링 완전 정복
강의중 로직이 복잡해지면, 테이블에서 관련 컬럼들을 다시 분리해야 하는날이 올 수 있다고하셨는데 컬럼을 다시 분리해야 할 때, 실무에서는 어떤 절차로 나누는지와 생길 수 있는 문제점에는 어떤 게 있나요?
미해결
김영한의 실전 데이터베이스 - 설계 1편, 현대적 데이터 모델링 완전 정복
외래키 제약조건을 통해 보다 정확한 데이터 무결성을 보장할 수 있을 것 같습니다. 하지만 실무에서는 외래키로 인해서 데드락이 발생하는 케이스가 있을 것 같습니다. 또한 외래키로 인해 운영 상에서 제약조건을 잠시 해제해야된다던가 하는 경우가 발생할 것 같은데, 실무에서도 외래키를 주로 걸고 운영할까요??
해결됨
김영한의 실전 데이터베이스 - 기본편
두개 이상의 테이블을 조인 할 때 서로 다른 테이블에 있는 데이터로 ORDER BY 정렬을 하게 되는 경우가 있을 것 같은데 이런 경우에는 인덱스를 어떻게 생성해야 하는지 궁금합니다
미해결
김영한의 실전 데이터베이스 - 기본편
학습하는 분들께 도움이 되고, 더 좋은 답변을 드릴 수 있도록 질문 전에 다음을 꼭 확인해주세요. 1. 강의 내용과 관련된 질문을 남겨주세요. 2. 인프런의 질문 게시판과 자주 하는 질문(링크)을 먼저 확인해주세요. (자주 하는 질문 링크: https://bit.ly/3fX6ygx) 3. 질문 잘하기 메뉴얼(링크)을 먼저 읽어주세요. (질문 잘하기 메뉴얼 링크: https://bit.ly/2UfeqCG) 질문 시에는 위 내용은 삭제하고 다음 내용을 남겨주세요. ========================================= [질문 템플릿] 1. 강의 내용과 관련된 질문인가요? (예/아니오) 2. 인프런의 질문 게시판과 자주 하는 질문에 없는 내용인가요? (예/아니오) 3. 질문 잘하기 메뉴얼을 읽어보셨나요? (예/아니오) [질문 내용] 안녕하세요! 강의를 듣다보니 db 파일들은 히스토리가 어떻게 관리되고 어떤 단위로 파일을 나누는지 궁금합니다!
미해결
김영한의 실전 데이터베이스 - 설계 1편, 현대적 데이터 모델링 완전 정복
안녕하세요, 김영한 지식공유자님. 현재 자바개발 2년차 개발자입니다. 자바와 DB공부를 병행하고 있습니다. 자바와 스프링 공부 vs SQLP 공부로 고민을 한다면, 자바와 스프링 공부보다 SQLP를 따기위한 노력에 가중치 높이는게 좋은 선택일까요?
미해결
김영한의 실전 데이터베이스 - 설계 1편, 현대적 데이터 모델링 완전 정복
안녕하세요. 강사님의 강의를 2회독하며 궁금한 것들이 어느정도 정리가 되어 질문 드립니다. 제가 SI에 있어서 그런건지 혹은 프로젝트? 운이 없어서인지 차세대를 하더라도 돌이켜보면 경험했던 실무에서는 늘 자연키를 PK로 사용 했었습니다. 그러다보니 UPDATE, DELETE등 데이터를 핸들링 할 때에도 늘 PK(자연키)를 전부 들고다니며 사용 했었는데 대리키를 PK로 사용할 경우에는 PK도 항상 같이 다른 데이터 들과 함께 객체등에 담는지.. 혹은 데이터를 갱신 할 때에만 자연키들로 따로 pk를 조회 한 후 사용하는지 아니면 unique 조건이 걸린 자연키들로만 갱신을 하는지 궁금해서요 ㅜㅜ
미해결
김영한의 실전 데이터베이스 입문 - 모든 IT인을 위한 SQL 첫걸음(SQL부터 차근차근)
mysql 커뮤니티버전과 사용버전의 차이가 크게 없는건가요?