바흐다나우 어텐션에서 모든 입력 토큰을 참조하는 이유 와 그로인한 바흐다나우 어텐션 장점이 무엇인지 궁금해요! 찍어주신 강의에서는 아래와 같이 정리해볼 수 있었는데요, 어떤 장점이 있는지 궁금해서 질문드립니다! - 방법 : 출력 토큰을 생성할 때, 모든 입력 토큰을 참조하고, 입력 토큰별로 중요도를 기록한다. - 단점 : 토큰양이 많아질 수록 저장공간 문제가 발생한다. - 단점으로 인한 제약 : 입력 텍스트 길이에 제한이 발생한다. 좋은 강의 감사합니다.
[WinError 1114] DLL 초기화 루틴을 실행할 수 없습니다. Error loading "c:\Users\testos\AppData\Local\Programs\Python\Python310\lib\site-packages\torch\lib\c10.dll" or one of its dependencies. 이렇게 오류가 뜨면서 설치가 되지 않습니다ㅠㅠ 프로그램은 visual studio code 사용중입니다!
앞 텍스트들로 다음 단어 하나를 예측한다고 했는데, 왜 슬라이딩 윈도에서는 입력과 타깃이 겹쳐져있는건가요? 또한 앞 텍스트부터 누적한 다음, 타깃 한 단어만 예측하는 것으로 이해했습니다. 왜 4개씩 나누는 것인지 궁금합니다. 왜 갑자기 슬라이딩 윈도우로 넘어간것인지 그 중간단계가 이해되지 않습니다.
안녕하세요 강사님 강의 잘 듣고 있습니다. 강의 내용중 좀 더 이해하고 싶은 부분이 생겨 질문드립니다. #질문 1 8분53초의 화면상의 ppt 슬라이드를 보면 행렬의 shape를 (a,m ), (m *n ), (a, n) 적어주셨는데 각각의 의미가 궁금합니다. (a,m) 은 무엇을 의미하는 행렬이며 이때 a,m각각은 무엇을 나타내는지, (m*n) 행렬은 무엇을 의미하는 행렬이며 m,n은 무엇을 나타내는지 (a,n) 행렬은 무엇을 의미하는 행렬이며 a,n은 무엇을 나타내는지. ( 제 추측으론, m은 모델의 vocabulary 사전의 개수. 또는 토큰id의 max값 같기도하고...n은 벡터의 길이 같기도하고....) #질문 2 그리고 파인 튜닝을 위해 qlora n*n 행렬이 그림상에 추가되었는데, 개념적으로 데이터가 추가되었다고는 이해되는데 실제 물리적으로는 데이터가 어떻게 추가된것인지 궁금합니다. 단순히 m*n 행렬에 n행이 추가되어 m+n, n 행렬이 되었다든지...
OpenAI를 활용한 나만의 AI 에이전트 만들기 (Agent Builder, GPT-5, Chatkit, Cloudflare, MCP, Fine Tuning, CoT 등)
https://platform.openai.com/chat/edit?models=gpt-5-nano 여기에서 tools > add 선택, MCP Server를 선택하면, Add Connector 팝업이 뜨는데, 계속 무한로딩되면서 화면에 아무것도 뜨지가 않습니다. 검색해보니 맥os는 시스템설정 > 보안에 가면 MCP관련해서 설정을 열어줘야 한다는데 관련 내용도 보이질 않네요. 혹시 무엇이 문제일까요? ==> 다음날 어떤 작업도 하지 않았는데 저절로 해결이 되었습니다. 어떤 이유로 해결되었는지 모르겠습니다.
5.5 실습진행하면서 오류가 발생해서 문의 드립니다. 주피터 노트북 진행 환경 입니다. 오류는 203 페이지 진행중에 발생 settings, params = download_and_load_gpt2(model_size="124M", models_dir="gpt2") file download 이후 오류로 그림과 같습니다. 혹시 해결가능한 방법이 있을까요? 여기서 막히면 다음 진행이 어려울 까요? 확인 부탁드립니다.
OpenAI를 활용한 나만의 AI 에이전트 만들기 (Agent Builder, GPT-5, Chatkit, Cloudflare, MCP, Fine Tuning, CoT 등)
13강 MCP 실습 2 (Google Drive)에서 Refresh Token 생성이 안됩니다. 어떻게 처리해야 하는 지 도와주시면 감사하겠습니다. 우선, 동의화면을 구성할 때, "대상"을 "내부"로 할 수 가 없어서 "외부"로 하였습니다 (Goolge Workspace를 사용하지 않아서 "내부"를 선택하지 못한다는 메세지 발생) OAuth 2.0 Playground에서 REFRESH_TOKEN 발급을 진행하는 중 마지막 과정에서 "엑세스 차단됨: Smithery Test는 Google 인증 절차를 완료하지 않았습니다" 오류 메세지 후 더 이상 진행되지 않음
gemma 2b 모델 runpod 클라우드 사용하지 않고도 로컬 runpod 을 띄워서 구동이 가능할거 같은데 가능할까요? 클라우드 비용을 지불 하고 찾아보니 16GB 정도면 넉넉하다고 하네요ㅠ https://merlio.app/blog/run-google-gemma-2b-locally runpod 기본 크레딧 충전이 10달러인데 간단한 처음 입문하는 분들 입장에서는 실습으로 쓰기에 부담이 좀 될거 같습니다.
Chapter2에서 슬라이딩 윈도우 만들때 stride를 128로 했는데요, 타깃은 인풋 마지막 토큰의 다음번째 토큰을 예측 하기 위해 for문을 돌면서 첫번째 타깃은 2번째 토큰, 다음은 3번째 토큰.. 이런식으로 되는걸로 아는데 갑자기 128로 건너 뛰는 이유는 무엇인지요?
해당 강화학습 모델이 어떤 의미를 가지는지 궁금합니다. 그냥 자산배뷴비율 백테스트로 gridsearch식으로 비율을 다르게 해서 지표가 가장 좋은걸 찾는 방법과 강화학습을 사용한것과 어떻게 다른것인지 궁금하네요. 강화학습을 사용했기때문에 리밸런싱 시기마다 자산 등락 경향을 참고해서 다음 최적의 리밸런싱 비율을 구하는건가요?