문서에서 텍스트를 추출해서 벡터 DB를 구축한 뒤 검색하는 RAG 시스템을 공부하고 있습니다. 지금 고민은 표 같은 2차원 데이터를 LLM이 인식하도록 구현하는 부분입니다. 문서에 포함된 표를 JSON형태로 만들어 모델의 입력으로 집어 넣어야 한다고 알고 있습니다만, 이 변환 방법에 대해 많은 고민을 하는 중입니다. OCR을 사용하는 것도 고려중입니다만, OCR을 이용해 가능한 기능이 텍스트 추출까지인지, 인식한 텍스트를 특정 양식으로 변환까지 가능한 건지 이 부분도 궁금합니다. (단순 텍스트 추출까지만 가능하다고 하면 리소스 최소화 측면에서 Computer Vision으로 극복하고 NLP나 RAG 구현에 집중하고 싶습니다.) 혹시 이 부분을 해결하신 경험이 있다면 많은 조언 부탁드립니다.
안녕하세요, 현업에서는 PHP, Java를 주로 다루고 있는 개발자입니다. 요 근래 LLM, RAG, LangChain 등 지능형 챗봇이라던지 AI Agent를 개발하기 위한 기술들에 대한 관심이 있었지만 이쪽 분야에 지식이 없다보니, 이것저것 알아보던 중 반가운 소식을 맞이하게 되었습니다. 아무래도 AI쪽과 관련된 개발은 Python을 주로 다루는 것 같더라구요. 그래서 현재 업무 외 시간에 Python을 학습중에 있는데, 어느정도 레벨이 되어야 이번에 출판될 책을 구매 후 읽었을 때 이해도 수월하고, 손 쉽게 따라서 코딩할 수 있을지 궁금합니다. (저의 목표 중 하나는 PHP, Java로 개발된 서비스에 Python으로 개발한 지능형 챗봇(Ex. 유저의 질문의 맥락을 파악하여 유사한 홈페이지 컨텐츠 찾아주는 봇 등...)을 연동시키는데 있습니다.) 그리고 이런 분야는 데이터분석, 빅데이터 영역과는 별개의 영역인지도 궁금합니다! 지식이 얕아 질문의 내용이 다소 미흡하더라도 너그러운 양해 부탁드립니다. [제이쓴님 출판 공지...] https://inf.run/E4Ea7
고등학교 IT과 재학중인 17살 고등학생입니다. AI서비스 개발 관련 관심이 생겨서 강의를 구매하고 보고있어요. 1강부터 5강까지 보았는데, 내용이 이해가 안됩니다. 예를 들어 강사님이 혼자 코드를 짜시는 걸 보면, 설명을 안해주시고 넘어가시는 부분, 그리고 강사님이 하는 방법을 따라하고 싶지만 제가 부족해서 못 따라하는 부분 등등.... 강사님 잘못이라는 게 아니라, 이런 부분에서 이 강의를 듣기전에 먼저 공부 후 이 내용을 다시 들어야 이해가 될 것 같습니다. 공부를 무슨 공부를 해야하고, 강의 관련 좋은 강의도 있으면 추천도 부탁드립니다. 강의 내용은 수강평 보면 정말 좋은 것 같아요. 그래서 더 제대로 배우고 싶습니다. 이 강의를 이해하려면 사전에 무슨 공부를 해야하고 어떻게 해야하는 지 자문을 구하고싶습니다!!
안녕하세요 이번에 '중, 고등학교 입시'를 기반으로 한 개인 프로젝트를 진행하고 있습니다. 백이랑 프론트는 개발이 끝나고 AI 개발만 남았습니다. 파인튜닝은 사용한 경험은 있지만, RAG를 경험하지 않아 감이 안잡히는데, 제 주제의 경우 둘 중 어떤 것을 활용하는게 더 나을지 궁금합니다. 그리고 추천해주실 툴이 있다면 적어주시면 감사드리겠습니다. (ex) Pod, Hugging face, pandas)
안녕하세요. 학습 내용 너무 잘 듣고 있습니다. 관련 기술을 이용해서 작은 작업을 하고 있는데, 데이터를 어떻게 저장을 해야 하는지 감이 안와서 글을 남깁니다. 지금 각 대학별 입학 모집요강 관련 데이터를 저장해서 검색을 해보려고 시도하고 있습니다. 고려대학교, 연세대학교 등 각 사이트에서 모집요강 pdf를 이용해 각 페이지별로 벡터 디비에 저장을 했습니다. 근데 하다보니깐, pdf의 내용이 각 대학별로 다르고 양도 많아서 데이터를 규칙이 있는 상태로 만들어서 데이터를 저장을 해야 할 거 같은데요. 질문1) 각 대학별로 데이터를 한번 다듬어서 저장을 하고 싶은데요, 이런 경우에는 실제로 어떤 방법으로 하면 좋을지 조언 부탁드리겠습니다. 질문2) 데이터가 저장 되면 청크 단위로 저장이 되었을 경우, 예를 들어 고려대학교-청크1,청크2,청크3,청크4... 연세대학교-청크1,청크2,청크3,청크4... 이렇게 다건으로 저장이 될텐데, 질문을 '서울에 있는 대학 모집 정보를 알고 싶어'(포괄적질문), '고려대학교 입학 조건을 알고싶어'(조건적질문) 등으로 한다면, 각 청크가 각 대학별 정보라는걸 추적해서 하나의 정보로 봐야하는데, 이런 경우에는 데이터 관리를 어떻게 해야하는지 조언 부탁드리겠습니다.
해당 API키 사용하는 계정에서 10달러 추가하고 왔는데도 아래와 같은 메시지가 나오네요...;; RateLimitError : Error code: 429 - {'error': {'message': 'You exceeded your current quota, please check your plan and billing details. For more information on this error, read the docs: https://platform.openai.com/docs/guides/error-codes/api-errors .', 'type': 'insufficient_quota', 'param': None, 'code': 'insufficient_quota'}} .env 파일 안에 "OPENAI_API_KEY"라는 이름으로 넣어놨습니다.