inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

처음 해보는 맞춤형 LLM 만들기 – LoRA & QLoRA 파인튜닝 입문

QLoRA기반 llama3.1 및 llama2 파인튜닝 실습-1

20강에서 파인튜닝 때 사용한 데이터가 없어졌습니다. LoRA Trainer 매개변수도 라이브러리 업그레이드로 수정되었습니다.

54

spacenyi

작성한 질문수 2

0

QLoRA 시 데이터 교체 :
dataset = load_dataset("chukypedro/finetune", split="train")데이터가 없어져서,
dataset = load_dataset("chukypedro/finetune", split="train")로 대체하였습니다. 

허깅페이스 사이트 들어가서 검색해도 chukypedro/finetune데이터는 없습니다

LoRA Trainer에서 파라미터명이 바뀌었습니다.

trainer = Trainer(
    model=model,  # 학습할 모델
    args=training_args,  # 학습 설정
    train_dataset=tokenized_dataset,  # 학습 데이터
    # tokenizer=tokenizer,  # 텍스트 디코딩용(구버전 (4.45 이하))
    processing_class=tokenizer, # 최신 버전 (4.46 이상)
    data_collator=data_collator,  # 배치 구성 도우미
    compute_metrics=compute_metrics  # <-- 여기 추가
)

딥러닝 NLP 인공지능(ai) llm fine-tuning

답변 1

0

인프런 AI 인턴

안녕하세요, 인프런 AI 인턴입니다. spacenyi님, 질문해 주셔서 감사합니다.

LoRA & QLoRA 파인튜닝 입문 강의에서 말씀하신 두 가지 문제에 대해 해결 방법을 안내드리겠습니다.

1. 데이터셋 문제

말씀하신 것처럼 load_dataset("chukypedro/finetune", split="train")와 같은 데이터셋이 없어졌다면, 다른 공개 데이터셋을 사용하시거나, 직접 만든 데이터셋을 사용하셔야 합니다. Hugging Face의 데이터셋을 사용할 때는 권장되는 방법은 최신 검색 방법으로 원하는 데이터셋을 찾아 대체하는 것입니다.

Hugging Face의 Datasets 라이브러리를 사용하여:

from datasets import load_dataset

# 예시로, 다른 공개 데이터셋을 사용
dataset = load_dataset("dataset_name", split="train")

Hugging Face 데이터셋 라이브러리 페이지에서 원하는 주제나 목적에 맞는 데이터를 찾아보실 수 있습니다: Hugging Face Datasets

2. Trainer 매개변수 변경

라이브러리가 업데이트됨에 따라 파라미터 명이나 API가 변할 수 있습니다. 최신 버전의 Hugging Face transformers 라이브러리를 사용하실 경우, 명시된 대로 tokenizer 대신 processing_class 등으로 변경하시면 됩니다.

from transformers import Trainer

trainer = Trainer(
    model=model,  # 학습할 모델
    args=training_args,  # 학습 설정
    train_dataset=tokenized_dataset,  # 학습 데이터
    processing_class=tokenizer, # 최신 버전에서의 텍스트 디코딩용
    data_collator=data_collator,  # 배치 구성 도우미
    compute_metrics=compute_metrics  # 성능 평가 지표 설정
)

참고 링크

저는 질문자님의 이해를 돕고자 지식공유자님의 기존 답변을 참고하여 유사한 답변 링크를 추천해드리고 있습니다.

현재 베타 기능으로 답변이 만족스럽지 않을 수 있는 점 양해 부탁드립니다. 🙏 추가적으로 궁금한 점이 있으시면, 이어서 질문해 주세요. 곧 지식공유자께서 답변해 주실 것입니다.

gpt 모델계열 및 추론강도에 대한 문의

0

4

0

wave terminal 설치 문의

0

4

1

pytorch 설치 업데이트좀요

0

7

2

커서 색상 및 클로드코드 프롬프트 입력칸 설정 문의

0

4

1

22강 빌드가 에러가 납니다

0

2

0

unit 3.9 kanban google workspace 인증 문제

0

5

2

강의 제작

0

6

0

클로드 질문에서 줄 바꿈

0

7

1

Json.stringify 관련 오류일까요?

0

6

2

깃허브 저장소에 코덱스 연동하는 방법 문의드립니다

0

12

1

2강 퀴즈를 푸려는데 자꾸 수강하지 않은 수업이있는데.. 다들었습니다 ㅜ

0

12

1

Gradio 실행 시 에러 발생 문의

0

9

2

Gradio 실행 시 Jinja2 / ASGI TypeError: unhashable type: 'dict' 에러 문의

0

9

2

7강 보고 있는데요.. 글자가 너무 작아요

0

3

0

안녕하세요, 강의자료 요청드립니다

0

9

1

VPS에서 tailscale 연결이 끊어졌을 경우

0

11

0

자료실 문의합니다. AIDU 툴 다운받으려고합니다.

0

4

0

vps tailscale 가장 최근 강의가 뭔지 못찾겠어요.

0

20

2

pc에서는 괜찮은데 탭으로 들으니 화면확대시 화면이 까맙니다

0

43

1

모든 자료 다운로드 누를때마다 똑같은 excel파일이 다운로드 받아짐. 노션 주소 공유되나요?

0

74

2

타임아웃 문제

0

132

2

강의 버퍼링 문제

1

103

1

추가 강의는 언제 올라오나요?

0

108

1

OPT350 모델 페이지 주소 좀알려주세요

0

116

1