안녕하세요. 코드 2-3의 SimpleTokenizerV1을 실행한 결과에 대해 문의드립니다. 아래 코드를 실행해보니 원문 text와 decode로 복원한 text가 조금 다릅니다. 원문과 복원한 text가 다르면 문제가 있을지 문의드립니다. class SimpleTokenizerV1: def __init__(self, vocab): self.str_to_int = vocab self.int_to_str = {i:s for s,i in vocab.items()} def encode(self, text): preprocessed = re.split(r'([,.:;?_!"()\']|--|\s)', text) # 'hello,. world' preprocessed = [ item.strip() for item in preprocessed if item.strip() ] ids = [self.str_to_int[s] for s in preprocessed] return ids def decode(self, ids): text = " ".join([self.int_to_str[i] for i in ids]) # 구둣점 문자 앞의 공백을 삭제합니다. text = re.sub(r'\s+([,.?!"()\'])', r'\1', text) return text tokenizer = SimpleTokenizerV1(vocab) text = """"It's the last he painted, you know," Mrs. Gisburn said with pardonable pride.""" ids = tokenizer.encode(text) print(text) print(ids) print(tokenizer.decode(ids)) "It's the last he painted, you know," Mrs. Gisburn said with pardonable pride. [1, 56, 2, 850, 988, 602, 533, 746, 5, 1126, 596, 5, 1, 67, 7, 38, 851, 1108, 754, 793, 7] " It' s the last he painted, you know," Mrs. Gisburn said with pardonable pride.
답변이 hallucinated인지 판별하는 노드에서 max_tokens를 100으로 설정했을 때는 올바르게 판단이 됐습니다. 그렇다면, 답변의 길이가 너무 길어서 모델이 hallucination 여부를 제대로 판별하지 못했다고 보신 건가요? 다만 이런 경우라면, 답변의 길이를 조정하기보다는 hallucination 여부를 판별하는 모델 자체를 조정하는 게 더 적절하지 않을까요? 실무 환경에서도 이런 상황이 발생할 수 있을 것 같은데, 보통은 답변 생성 모델을 판별 모델에 맞추는 게 일반적인지, 아니면 판별 모델을 답변 생성 모델에 맞추는 게 더 낫다고 보는지 궁금합니다.
Chapter2에서 슬라이딩 윈도우 만들때 stride를 128로 했는데요, 타깃은 인풋 마지막 토큰의 다음번째 토큰을 예측 하기 위해 for문을 돌면서 첫번째 타깃은 2번째 토큰, 다음은 3번째 토큰.. 이런식으로 되는걸로 아는데 갑자기 128로 건너 뛰는 이유는 무엇인지요?
코드 5줄의 마법, 5줄 머신러닝 PyCaret: 데이터 분석 프로젝트에 AutoML 날개 달기
ydata_profiling 버전 확인 시 'v4.17.0' 입니다. 이슈 해결을 위해 노력해보았으나 너무 어려워 확인 부탁드립니다. 버전 충돌 문제인 지 어렵네요.. 처음에 Overview 화면은 잘 나오나 뒤에 Correlations 등 클릭하면 다시 미니 주피터랩 화면으로 나타납니다. html로 저장하여 확인 시에는 전부 다 잘 확인되는데 notebook 화면에서 확인이 안됩니다. notebook화면에서 확인할 수 있는 방법 알려주시면 감사하겠습니다. conda 명령어로도 실행해보았으나 동일한 이슈가 발생합니다. conda install -c conda-forge ydata-profiling import numpy as np import pandas as pd from ydata_profiling import ProfileReport df = pd.DataFrame(np.random.rand(100, 5), columns=["a", "b", "c", "d", "e"]) profile = ProfileReport(df, title="YData Profiling Report") profile
안녕하세요 한기용 지식공유자님. 37. 앞서 Airflow 예제를 개선해보자 (v4) - 실습 강의에서 데이터의 벌크 업로드를 위해 dag의 insert into 코드를 copy into로 변경했습니다. 그러나 이 경우 기존에 한 줄씩 insert into 하던 방식보다 더 느린 결과가 나옵니다(insert into의 경우 2분, copy into의 경우 3분) 개인적으로는 제 컴퓨터의 IO 연산이 좋지 않고, 데이터의 양이 크지 않아서 오버헤드가 더 크기 때문인 것으로 예상하고 있는데, 지식공유자님의 의견도 알고 싶습니다 🙂
한 번에 끝내는 AI 에이전트 개발 올인원 (w. LangGraph, Google ADK, CrewAI)
from firecrawl import Firecrawl firecrawl.search(query, limit=5, integration="crewai") ... TypeError: search() got an unexpected keyword argument 'integration' 환경 패키지: firecrawl-py 3.4.0 문서 관련 Firecrawl Python SDK 페이지에 search() 파라미터 목록이 나와 있으나 integration 항목은 보이지 않습니다. docs.firecrawl.dev Search API 레퍼런스/가이드에도 query , limit , sources , location , timeout 등은 보이나 integration 은 확인하지 못했습니다. 사실 어떻게 연동하는지에 대한 초점이 맞춰져 있어서 작성을 망설였는데, 학습하다 보니 궁금해서 작성하게 되었어요. integration 없이 호출해도 괜찮은지 확인 부탁드려요.
문제 / 오류 / 질문에 대해 설명해 주세요 n8n에서 MCP 클로드로 연결이 안되요. 하단의 첨부된 이미지 같이 오류가 발생됩니다. 오류 메시지가 있다면 작성해 주세요 사용 중인 워크플로우를 공유해 주세요 n8n 설치 정보 안내 n8n 버전: 데이터베이스 종류 (기본값: SQLite): n8n 실행 프로세스 설정 (기본값: own, main): n8n 실행 방식 (예: Docker, npm, n8n cloud, 데스크탑 앱 등):Docker 운영 체제:윈도우10