inflearn logo
강의

강의

N
챌린지

챌린지

멘토링

멘토링

N
클립

클립

로드맵

로드맵

지식공유

llm 파인튜닝 deepspeed checkpointing 용량 초과 이슈

531

태호

작성한 질문수 1

0

혹시 deepspeed로 학습중에 checkpoint가 ssd 용량을 너무 많이 잡아먹지 않게 하려면 어떻게 해야 하나요?? 클라우드 머신으로 10시간짜리 학습중간에 멈춰버려서.. 넉넉찮은 주머니 사정에 타격이 오고 있습니다. 체크포인팅을 할려고 해도 이상하게 용량이 순식간에 300GB를 먹어버리더라구요. 그래서 용량 초과로 에러가 나서 학습이 멈춰버리는 상황입니다. 혹시 이러한 경험 해보셨다면 지혜를 나눠주시면 정말 감사드리겠습니다(- -)(_ _)

llm deepspeed checkpoint 파인튜닝

답변 1

0

인프런 AI 인턴

안녕하세요, 인프런 AI 인턴입니다.

태호님, DeepSpeed를 사용하여 학습 중인 체크포인트의 용량 문제로 고민이 크시겠어요. DeepSpeed의 체크포인팅은 매우 많은 저장 공간을 요구할 수 있는데요, 다음과 같은 방법으로 용량을 절약해볼 수 있습니다:

  1. 체크포인트 간격 조정: 체크포인트가 발생하는 간격을 늘려 저장되는 체크포인트 수를 줄일 수 있습니다.

  2. 체크포인트 가시화: 필요한 데이터만 선택적으로 체크포인트에 저장하는 기능으로, 모든 데이터를 저장할 필요가 없을 경우 사용할 수 있습니다.

  3. 오프로딩 설정: DeepSpeed의 오프로딩 기능을 사용하여 CPU나 NVMe SSD와 같은 추가적인 저장 공간으로 체크포인트를 옮길 수 있습니다.

  4. 모델 크기 재조정: 모델 크기를 줄여서 체크포인트 용량 자체를 감소시키는 것도 한 가지 방법입니다.

  5. 최적화된 저장 포맷 사용: 체크포인트 데이터를 효율적으로 압축하여 저장할 수 있는 포맷을 사용할 수 있습니다.

혹시 이러한 기능들을 이미 적용해보셨는데도 문제가 해결되지 않는다면, DeepSpeed의 공식 문서나 커뮤니티, GitHub 이슈 트래커 등에서 추가적인 도움을 받을 수 있을 것입니다.
또한, 크라우드 서비스 제공업체의 스토리지 관련 최적화 옵션이나 가격 정책을 확인해보는 것도 좋은 방법일 수 있습니다.

이러한 해결책들이 재정적인 부담을 조금이라도 덜어드릴 수 있기를 바라며, 궁금한 점이 있다면 언제든 문의해 주세요!

슬라이드 오타

0

9

0

LLM 서비스의 신뢰성

1

20

1

[13번 강의] ChatInterface에 PDF 렌더링이 안되는 이슈 공유

0

19

1

워킹플로우 제목 생성 오류와 키워드 미생성 오류

0

17

1

채팅플로우 실행시 진전이 없고 비슷한 류의 답변만 나와요

0

26

4

노드

0

34

1

기초실습 BERT파인튜닝 예제 오류

0

26

1

54강 양자화의 끝판왕, 터보퀀트 (예정) 강의 업로드

0

30

1

블로그에 학습 내용 올려도 되나요?

0

34

1

kernel crash 문의

0

48

2

LLM Sampling 설정 관련

0

32

1

강의 자료(노션) 요청드립니다

0

29

1

공식 문서

0

53

1

입력언어의 차이에 대해 질문있습니다

0

43

1

모델 설정 : Gemini로 해도 되나요?

0

60

2

22강 빌드가 에러가 납니다

0

44

0

Gradio 실행 시 에러 발생 문의

0

85

2

Gradio 실행 시 Jinja2 / ASGI TypeError: unhashable type: 'dict' 에러 문의

0

165

2

7강 보고 있는데요.. 글자가 너무 작아요

0

42

1

파인튜닝 데이터가 이미 학습된 데이터인 경우 어떻게 되나요?

0

62

1

api key, access token이 평무으로 저장되는 것 같아요.

0

78

2

[ReadMe]영상에 나온거랑 깃이랑 다르네요

0

83

2

수업 자료 링크는 어디에 있나요?

0

93

2

RAG 파이프라인 고도화와 파인튜닝의 우선순위 및 실무적 판단 기준이 궁금합니다.

0

70

2