inflearn logo
강의

講義

知識共有

システムデザインの第一歩 with LLM:運用可能なAIサービス(RAG・AIエージェント)アーキテクチャ設計

LLMが追加されるとシステムデザインはどう変わるか?(核心目標)

LLM 서비스의 신뢰성

70

ehgus89102561

投稿した質問数 11

1

안녕하세요, 좋은 강의 잘 듣고 있습니다.

LLM 서비스의 핵심 목표 중 신뢰성의 핵심 키워드로 정확성, 일관성, 안정성 세 가지를 말씀해 주셨는데요, 이 중 정확성과 일관성이 각각 어떤 의미인지 좀 더 자세히 여쭤보고 싶습니다.

특히 앞에서 설명해 주신 것처럼 LLM은 확률에 기반을 두기 때문에 응답이 매번 바뀔 수밖에 없는데, 이런 전제 위에서 궁금한 점이 두 가지 있습니다.

  1. 일관성을 실제로 어떻게 구현할 수 있는지 궁금합니다. 실무에서 주로 쓰이는 방법이 있을까요?

  2. 일관성을 판단할 수 있는 지표나 기준, 기법이 있는지 궁금합니다. 신뢰성 지표로 Hallucination Rate, Faithfulness, Context Precision/Recall을 소개해 주셨는데, 이들은 주로 정확성 쪽에 가까워 보여서 일관성은 어떤 방식으로 측정하는지 궁금합니다.

    감사합니다.

아키텍처 소프트웨어-설계 시스템-디자인 llm rag ai-agent

回答 1

1

mindlantern

안녕하세요 도현님. 좋은 질문 남겨주셔서 감사합니다!


강의에서 신뢰성과 관련된 키워드로 정확성과 일관성을 언급했었는데요, 간단하게 정확성은 “응답 내용이 사실이나 서비스의 요구사항과 일치하는가”의 의미로, 일관성은 “같은 조건에서 서비스가 모순되지 않는 응답을 주는가”의 의미로 언급한 것이었습니다. 예를 들어 같은 대화 내에서 일관되지 않은 응답을 주거나 같은 질문을 물어봤을때 매번 핵심 내용이 다른 대답을 하면 서비스 신뢰성이 떨어질 수밖에 없으니까요.


일관성을 높이기 위한 방법은 먼저 강의의 모델 선택 & 서빙 챕터에서도 설명했듯이 Temperature와 같은 샘플링 파라미터를 조절하여 같은 입력에 대해 LLM 출력의 랜덤성을 줄이는 방법이 있습니다.

그런데 사실 이것보다 더 중요한건 시스템을 설계할 때 일관되어야 하는 부분과 LLM의 확률성을 허용할 수 있는 부분을 나누는 것이라고 생각합니다. 예를 들어 정책과 같이 항상 동일해야하는 정보는 DB나 API 같이 명확한 Source of Truth에서 가져오도록 결정론적으로 설계할 수 있습니다. 마찬가지로 주문 가능 여부를 확인하거나 가격을 계산하는 것처럼 명확한 비즈니스 로직이 정해져있는 작업도 LLM이 직접 판단하기보다는 API나 Tool을 호출하여 일관되게 처리하도록 설계할 수 있습니다. LLM의 응답은 단위 테스트로 검증하기 어렵지만 이렇게 결정론적으로 구현할 수 있는 부분을 나눠서 단위 테스트를 통해 검증하면 변경으로 인한 회귀도 방지할 수 있다는 장점이 있습니다.


일관성의 측정은 정확성과는 조금 다르게 미묘한 부분이 있습니다. 실제 LLM 서비스를 평가할때 일관성 자체를 단일 지표로 측정하기보다는, 먼저 해당 서비스가 의도한 대로 올바른 응답을 하고 있는지 정확성 지표들을 평가하고, 필요한 경우 일관성을 추가적으로 측정하는 방식​으로 접근하는 경우가 많습니다.

예를 들어 소설이나 광고 문구를 생성하는 서비스라면 매번 다른 표현을 생성하는 것이 자연스럽기 때문에 일관성 측정의 필요성이 낮을 수 있지만, 이력서 평가 서비스나 데이터의 이상 징후를 분석하는 서비스처럼, 동일한 입력에 대해 일정한 판단 기준과 논리를 유지해야 하는 서비스라면 반복 실행에 따른 결과의 변동성을 별도로 평가할 필요가 있을 것입니다.

일관성 측정 지표는 정확성과 같이 몇 가지 지표로 표준화되어 있는 것은 아니어서 서비스에서 어떤 부분의 일관성이 중요한지를 먼저 정의하고 거기에 맞는 평가 지표를 만들어야합니다.

분류나 점수처럼 결과가 정형화되어 있다면 동일한 입력을 여러 번 실행하여 동일한 결과가 나온 비율을 측정할 수 있고, 자연어 응답이라면 응답 간 의미적 유사도를 비교하거나 서로 모순되는 내용이 있는지(Contradiction Rate) 측정할 수도 있습니다. 평가에는 NLI(Natural Language Inference) 모델이나 LLM-as-a-Judge 등을 활용할 수 있습니다. 그리고 대화형 서비스라면 이전 대화에서 언급한 정보나 판단이 이후 답변에서도 일관되게 유지되는지(Cross-turn Consistency)를 평가 지표로 사용할 수도 있습니다.


LLM 의 정확성, 일관성을 보장하고 측정하는 방법은 추후 ​섹션 6 부분에서도 좀 더 다룰 예정이니 참고해주시면 좋을 것 같습니다! 감사합니다.


스크립트 영상 미일치

0

26

3

1.13 다른 부분 정리

0

21

2

아무 수정도 안하고 주어진 소스로 그대로 했는데 패스워드 에러가 남

1

23

1

tdd green agent 에서 문의 드립니다.

0

17

1

처음 실행 시 계속 패스워드가 틀리다고 나옴. 수정하고 해도 마찬가지임

1

23

2

수업자료 관련 문의

0

21

3

1.12 강의랑 실제 진행이랑 조금 다릅니다.

0

37

2

Unit 1.13 — Telegram × Hermes 연동 가이드: 메신저로 에이전트와 대화하기

0

27

2

5강 녹음 소리 ㅠㅠ

0

33

2

github주소가 안보여요. ㅠ

0

41

2

deskrpg 최신 버전에서 게이트웨이 연결이 안됩니다.

0

36

2

카카오톡 sdk 로그인

1

26

1

강의 자료 요청드립니다.

0

31

1

극단적으로 from-to가 12일 이고, valid_to가 13일이면?

0

36

1

서브에이전트

1

34

1

ssh 연결

0

44

1

참고 자료 요청

0

38

1

2강 - 눈에 보이는 낭비, 눈에 보이지 않는 낭비: 값의 의미

1

36

1

스크립트 한국어로 나오다가 영어로 나옴

1

35

1

구현 방법에 대한 문의

0

56

2

docker deskop은 항상 켜놓아야하나요?

0

51

2

Owal Alpha무료모델 없음

0

47

2

슬랙에서 소피가 호출되지 않아요.

0

62

3

IVF vs HNSW

1

58

1