안녕하세요 한기용 지식공유자님. 좋은 강의 잘 듣고 있습니다. ELT를 구현할 때 SWAP 명령어를 사용한 정확한 이유가 궁금합니다. 제가 찾아본 바로는 SWAP 명령어는 포인터 교체 방식으로 '즉시' 데이터와 메타데이터가 교체되므로, 무중단 배포가 가능하다는 것이 장점인 것 같습니다. 사실, 트랜잭션을 활용해도 같은 기능을 구현할 수 있을 것 같은데 메타데이터 복제를 빠뜨리는 것을 예방하고, 트랜잭션을 활용하였을 때보다 성능이 우수하고, lock을 예방하기 때문에 SWAP 문법을 활용하는 걸까요?
from google.colab import files upload = files.upload() 위 명령어 실행없이 바로 데이터 불러올수없나요? 퇴근후딴짓님처럼 바로 df=pd.read_csv("members.csv") 로 불러오고싶은데 에러가 나네요 No such file or directory:members.csv
코드 5줄의 마법, 5줄 머신러닝 PyCaret: 데이터 분석 프로젝트에 AutoML 날개 달기
# --- [핫픽스] dask ↔ sktime 호환 패치 --- import types try: import dask.dataframe as dd # 최신 라이브러리 구조 변화에 대응하여 호환성을 맞춰주는 코드 # 상세한 내용을 이해할 필요는 없으며, 안정적인 실행을 위한 장치로 이해하세요. if not hasattr(dd, "core"): dd.core = types.SimpleNamespace() if not hasattr(dd.core, "DataFrame"): try: from dask.dataframe import frame as _frame dd.core.DataFrame = _frame.DataFrame except ImportError: class _DummyDF: pass dd.core.DataFrame = _DummyDF except ImportError: pass # dask가 설치되지 않은 환경에서는 무시합니다. 들여쓰기가 제대로 되어있지 않아 노션의 코드를 복사하여 붙여넣을 시 에러납니다.
1) 해당 부분에서 비교연산자가 이상/이하가 아니고 초과/미만을 사용하고 있는데 분위수값에 해당하는 값이 있으면 그 결과가 다를꺼 같아서요. 25% 데이터 구하세요 하는 문제는 정의자체가 분위수값 미만의 값 이런식으로 정해진건가요? 2) 하위 25% 데이터를 구하는 함수가 있다면, 상위 25%는 ~ 를 이용해서도 함수를 쓸 수 있을까요? 3) 가장 큰 값이 두개 이상인경우 더 앞선것을 불러오던데, 해결방법이 있을까요? (가장 큰 값이 동일한경우 모든 인덱스를 불러오게끔)
코드 5줄의 마법, 5줄 머신러닝 PyCaret: 데이터 분석 프로젝트에 AutoML 날개 달기
ydata_profiling 버전 확인 시 'v4.17.0' 입니다. 이슈 해결을 위해 노력해보았으나 너무 어려워 확인 부탁드립니다. 버전 충돌 문제인 지 어렵네요.. 처음에 Overview 화면은 잘 나오나 뒤에 Correlations 등 클릭하면 다시 미니 주피터랩 화면으로 나타납니다. html로 저장하여 확인 시에는 전부 다 잘 확인되는데 notebook 화면에서 확인이 안됩니다. notebook화면에서 확인할 수 있는 방법 알려주시면 감사하겠습니다. conda 명령어로도 실행해보았으나 동일한 이슈가 발생합니다. conda install -c conda-forge ydata-profiling import numpy as np import pandas as pd from ydata_profiling import ProfileReport df = pd.DataFrame(np.random.rand(100, 5), columns=["a", "b", "c", "d", "e"]) profile = ProfileReport(df, title="YData Profiling Report") profile
안녕하세요 한기용 지식공유자님. 37. 앞서 Airflow 예제를 개선해보자 (v4) - 실습 강의에서 데이터의 벌크 업로드를 위해 dag의 insert into 코드를 copy into로 변경했습니다. 그러나 이 경우 기존에 한 줄씩 insert into 하던 방식보다 더 느린 결과가 나옵니다(insert into의 경우 2분, copy into의 경우 3분) 개인적으로는 제 컴퓨터의 IO 연산이 좋지 않고, 데이터의 양이 크지 않아서 오버헤드가 더 크기 때문인 것으로 예상하고 있는데, 지식공유자님의 의견도 알고 싶습니다 🙂
한 번에 끝내는 AI 에이전트 개발 올인원 (w. LangGraph, Google ADK, CrewAI)
from firecrawl import Firecrawl firecrawl.search(query, limit=5, integration="crewai") ... TypeError: search() got an unexpected keyword argument 'integration' 환경 패키지: firecrawl-py 3.4.0 문서 관련 Firecrawl Python SDK 페이지에 search() 파라미터 목록이 나와 있으나 integration 항목은 보이지 않습니다. docs.firecrawl.dev Search API 레퍼런스/가이드에도 query , limit , sources , location , timeout 등은 보이나 integration 은 확인하지 못했습니다. 사실 어떻게 연동하는지에 대한 초점이 맞춰져 있어서 작성을 망설였는데, 학습하다 보니 궁금해서 작성하게 되었어요. integration 없이 호출해도 괜찮은지 확인 부탁드려요.