현재 국가전산망 화재로 소득세법을 '국가법령센터'가 장애중입니다. 대체사이트인 (사법정보공개포탈)에서는 PDF와 TXT만 다운로드가 가능합니다. 대부분 pdf화일 문서가 많은데, word말고 pdf문서를 임베딩하는 방법/강의가 있었으면 합니다. 추가로, 문서내 텍스트외에 도형이나 표같은경우는 어떻게 임베딩을 하면 좋을까요?
from google.colab import files upload = files.upload() 위 명령어 실행없이 바로 데이터 불러올수없나요? 퇴근후딴짓님처럼 바로 df=pd.read_csv("members.csv") 로 불러오고싶은데 에러가 나네요 No such file or directory:members.csv
코드 5줄의 마법, 5줄 머신러닝 PyCaret: 데이터 분석 프로젝트에 AutoML 날개 달기
# --- [핫픽스] dask ↔ sktime 호환 패치 --- import types try: import dask.dataframe as dd # 최신 라이브러리 구조 변화에 대응하여 호환성을 맞춰주는 코드 # 상세한 내용을 이해할 필요는 없으며, 안정적인 실행을 위한 장치로 이해하세요. if not hasattr(dd, "core"): dd.core = types.SimpleNamespace() if not hasattr(dd.core, "DataFrame"): try: from dask.dataframe import frame as _frame dd.core.DataFrame = _frame.DataFrame except ImportError: class _DummyDF: pass dd.core.DataFrame = _DummyDF except ImportError: pass # dask가 설치되지 않은 환경에서는 무시합니다. 들여쓰기가 제대로 되어있지 않아 노션의 코드를 복사하여 붙여넣을 시 에러납니다.
안녕하세요, 강사님. 강의 덕분에 RAG를 활용한 챗봇을 성공적으로 구현해서 잘 사용하고 있습니다! (질문1) 다만, RAG 구조상 사용자의 질문과 가장 유사한 문서 조각(chunk)을 찾아서 그 안에서만 답변을 생성하다 보니, 전체 문서를 이해해서 답변을 해주지는 못하는 점이 아쉽습니다. RAG로 학습시킨 매뉴얼이 약 47페이지 정도이고 양이 많지 않은데, 이 전체 매뉴얼의 내용 전체를 이해하고 종합적으로 답변할 수 있는 방법이 있을까요? 출처를 알려줄 수 있는 RAG의 분명한 장점이 있어서, 현재의 RAG 기반 구조를 유지한 채 개선을 할 수 있는 방법이 있을지 궁금합니다. (질문2) 47페이지 문서 외에 더 자세한 매뉴얼을 추가로 반영하려고 하는데요, 이때 pinecone에 동일 DB(인덱스)로 그냥 추가하는게 좋을지 아니면 더 나은 구조가 있을지 조언 구하고 싶습니다. 감사합니다.
1) 해당 부분에서 비교연산자가 이상/이하가 아니고 초과/미만을 사용하고 있는데 분위수값에 해당하는 값이 있으면 그 결과가 다를꺼 같아서요. 25% 데이터 구하세요 하는 문제는 정의자체가 분위수값 미만의 값 이런식으로 정해진건가요? 2) 하위 25% 데이터를 구하는 함수가 있다면, 상위 25%는 ~ 를 이용해서도 함수를 쓸 수 있을까요? 3) 가장 큰 값이 두개 이상인경우 더 앞선것을 불러오던데, 해결방법이 있을까요? (가장 큰 값이 동일한경우 모든 인덱스를 불러오게끔)
코드 5줄의 마법, 5줄 머신러닝 PyCaret: 데이터 분석 프로젝트에 AutoML 날개 달기
ydata_profiling 버전 확인 시 'v4.17.0' 입니다. 이슈 해결을 위해 노력해보았으나 너무 어려워 확인 부탁드립니다. 버전 충돌 문제인 지 어렵네요.. 처음에 Overview 화면은 잘 나오나 뒤에 Correlations 등 클릭하면 다시 미니 주피터랩 화면으로 나타납니다. html로 저장하여 확인 시에는 전부 다 잘 확인되는데 notebook 화면에서 확인이 안됩니다. notebook화면에서 확인할 수 있는 방법 알려주시면 감사하겠습니다. conda 명령어로도 실행해보았으나 동일한 이슈가 발생합니다. conda install -c conda-forge ydata-profiling import numpy as np import pandas as pd from ydata_profiling import ProfileReport df = pd.DataFrame(np.random.rand(100, 5), columns=["a", "b", "c", "d", "e"]) profile = ProfileReport(df, title="YData Profiling Report") profile
안녕하세요 한기용 지식공유자님. 37. 앞서 Airflow 예제를 개선해보자 (v4) - 실습 강의에서 데이터의 벌크 업로드를 위해 dag의 insert into 코드를 copy into로 변경했습니다. 그러나 이 경우 기존에 한 줄씩 insert into 하던 방식보다 더 느린 결과가 나옵니다(insert into의 경우 2분, copy into의 경우 3분) 개인적으로는 제 컴퓨터의 IO 연산이 좋지 않고, 데이터의 양이 크지 않아서 오버헤드가 더 크기 때문인 것으로 예상하고 있는데, 지식공유자님의 의견도 알고 싶습니다 🙂
한 번에 끝내는 AI 에이전트 개발 올인원 (w. LangGraph, Google ADK, CrewAI)
from firecrawl import Firecrawl firecrawl.search(query, limit=5, integration="crewai") ... TypeError: search() got an unexpected keyword argument 'integration' 환경 패키지: firecrawl-py 3.4.0 문서 관련 Firecrawl Python SDK 페이지에 search() 파라미터 목록이 나와 있으나 integration 항목은 보이지 않습니다. docs.firecrawl.dev Search API 레퍼런스/가이드에도 query , limit , sources , location , timeout 등은 보이나 integration 은 확인하지 못했습니다. 사실 어떻게 연동하는지에 대한 초점이 맞춰져 있어서 작성을 망설였는데, 학습하다 보니 궁금해서 작성하게 되었어요. integration 없이 호출해도 괜찮은지 확인 부탁드려요.