파인튜닝 데이터가 이미 학습된 데이터인 경우 어떻게 되나요?
강사님께 질문드립니다.
수업을 듣다 문득 이런 생각이 들었습니다.
LLM은 엄청난 데이터를 학습했으니, 파인튜닝을 위해 제공한 학습자료가 이미 학습된 자료일 수도 있습니다. 비중에 따라 다를 수 있겠지만, 이럴때는 어떤 결과가 예상되는지 궁금합니다.
또한, 중복된 학습자료임을 LLM이 알고 알려주거나 뱉어낼 수 있는건가요?
답변 1
0
일단 두 번째 질문에 대해서 먼저 답하자면 LLM은 파인튜닝 자료가 자신이 알고 있는 자료임을 알 수 없고 그것을 LLM이 직접 알려주거나 뱉어낼 수는 없습니다. 일반적인 LLM은 자신이 특정 문장을 알고 있는지, 사전학습 과정에서 본 것인지, 파인튜닝 중에 본 것인지를 구분하거나 메타적으로 인식하지 못합니다.
첫 번째 질문에 대해서는 여러 가지 경우로 나눠서 생각해 보아야 할 것 같습니다. 사전학습 자료와 미세조정 자료의 의미와 표현이 일치하는 경우, 의미는 같은데 표현은 다른 경우, 기존 지식과 충돌하는 경우로 나눠서 생각해 봐야 할 것 같습니다.
각 경우별로 따지자면 내용이 길어지므로 요약해서 말씀드리자면, 일반적인 규모의 파인튜닝에서는 동일한 지식을 다시 학습하더라도 모델의 전반적인 성능 변화는 크지 않은 경우가 많습니다. 다만 데이터 규모, 학습속도(learning rate: 학습률), 반복학습 횟수(Epoch 수) 등에 따라 영향은 달라질 수 있습니다.
데이터가 매우 많거나, 학습 속도가 지나치게 빠르거나, 전체 파라미터를 미세 조정하하는 경우(Full Fine-tuning인 경우)나, 반복학습 횟수가 지나치게 크면 가중치에 큰 변화를 일으킬 수 있습니다.
특히 학습 속도가 적절치 않으면 파국적 망각(Catastrophic Forgetting) 현상이 일어날 수도 있습니다. 즉, 기존 지식 중 일부가 소실되고, 그 대신에 파인튜닝에 동원한 중복 학습 자료가 새로운 지식 형태로 더 강하게 자리잡는 현상이 벌어질 수 있을 것으로 보입니다.
이 답변은 저의 견해에 불과하니 반드시 실험적으로 확인해 보시기 바랍니다. 반면에 기존 지식을 강화하는 긍정 효과를 내게 할 수도 있을 것으로 보입니다. 어쩌면 좋은 실험 연구 주제가 될 수 있을 것 같습니다.
VPS 에서 oh-my-wiki 설정 관련 문의드립니다.
0
10
1
[강의질문] 30. 프로젝트 기억장(Memory Bank)과 AGENTS.md: 컨텍스트 4단계로 작은 앱 만들기
0
8
0
수업자료가 저만 못찾나요?
0
13
1
37강에서 ROADMAP.md 파일
0
16
1
.claude, setting~, permission 했을 때 Bash 안 보여요
0
11
1
[미션4] open with Live Server 클릭시 브라우저 안뜸
0
13
2
사용량 한도 도달
0
17
1
Cursor를 실행했을 때 나오는 화면이 달라요
0
15
1
Claude code 대화하는 부분이 위치변경 문의 드립니다.
0
15
2
6.2 기본 개발 스킬에 대해 문의 드립니다.
0
25
1
setting.local.json 파일 안보일떄
0
19
2
7. cowork desktop 앱 다운로드 문의
0
15
1
Substack 신청 문의
0
19
2
테마 개발의 한계, 업종이 대체 할 수 있을까요?
0
16
2
스킬 인식 질문
0
24
2
3강에서 배경만 변경하고 인물을 유지하는 방법
0
16
1
Shrimp Task Manager와 Fable5 plan모드 성능비교
0
21
2
git hub 들어가서 setting >> pages 들어갔는데
0
22
2
git config 오류 관련 문의
0
21
2
task master, shrimp task manager 질문있어요
0
16
1
모델 선정 기준
0
23
2
.,md...자료를 받고 싶습니다.
0
20
3
Statusline 결과값 보이지 않는 이유
0
23
2
강의교안, 소스코드 링크 문제
0
20
2





