[추석 특집] 실리콘밸리 개발자가 알려주는 LLM 평가 하네스 엔지니어링

LLM을 활용한 서비스를 만들면서 프롬프트나 모델을 바꾼 뒤, 이전보다 답변 품질이 떨어졌는지 확인하기 어려웠던 경험이 있다면 이 강의가 해결책이 될 수 있습니다. 직접 평가 기준을 만들고, 달라진 답변을 자동으로 찾아내는 방법을 배웁니다.

(4.8) 수강평 5개

수강생 95명

난이도 초급

수강기한 무제한

실습 중심
실습 중심
AI 활용법
AI 활용법
AI 코딩
AI 코딩
ai활용
ai활용
AI
AI
실습 중심
실습 중심
AI 활용법
AI 활용법
AI 코딩
AI 코딩
ai활용
ai활용
AI
AI
카카오
카카오뱅크
위메프
wemade
하이퍼커넥트

하이퍼커넥트

임직원들도 이 강의를 듣고 있어요!

카카오
카카오뱅크
위메프
wemade
하이퍼커넥트

하이퍼커넥트

임직원들도 이 강의를 듣고 있어요!

먼저 경험한 수강생들의 후기

4.8

5.0

Be Dev

91% 수강 후 작성

Eval이라는 평가 방식을 마스터 한다라기 보다는 "이런 개념들과 이런 검증 패턴들이 있다"정도로 알려주는 내용이라고 생각합니다. 즉 시야를 넓히는데 큰 도움이 된다고 느끼네요. 실제로도 저도 해당 강의를 수강하면서 꽤 신박한 주제라고 생각이 들었으니깐요.

5.0

seha incheon

83% 수강 후 작성

코드 수가 많고 파일도 많다보니깐, 그냥 복사하면서 진행하시는 과정에 있어서 따라가기 힘들다는 느낌이 조금 들었습니다. 그래도 내용이 너무나도 유익하고 생전 처음들어보는 주제라서 이런 단점을 감내할 수 있었던거 같아요. 특히나 평가를 하는 모델도 신뢰 할 수 없으니, 이 모델도 평가를 해야 하는데, 다시 또 모델이 평가하니깐 결국 신뢰가 불가능하다라는 관점으로 이해를 하면서 모델 평가의 결론은 사람이 고생해야 한다로 귀결되는 내용이라고 생각합니다. - 실제로 메타에서도 모델에 과제나 학습시키는데 사람을 더 고용했고 실제 인력을 더 많이 사용한걸로 알고 있는데, 그 관점이 여기서도 반영이 된거같아요.

5.0

우당탕탕

83% 수강 후 작성

강의 유익하게 잘 봤습니다!

수강 후 이런걸 얻을 수 있어요

  • LLM 응답을 수집하고 정량·정성 평가하는 도구 구현

  • 프롬프트와 모델 변경 전후의 품질 차이를 회귀 테스트로 검증

  • 평가 데이터셋과 명확한 LLM 평가 기준을 설계하는 방법

  • LLM Judge와 규칙 기반 평가를 조합해 신뢰도 높은 평가 파이프라인 구축

  • 실패한 응답을 추적해 프롬프트·검색·모델 중 문제 원인 분석

  • 평가 결과를 CI/CD에 연결해 LLM 서비스 품질을 지속적으로 관리

이런 분들께
추천드려요

학습 대상은
누구일까요?

  • LLM 서비스를 운영하며 프롬프트와 모델 변경의 영향을 검증해야 하는 개발자

  • LLM Agent와 RAG 서비스의 답변 품질을 체계적으로 평가하고 싶은 개발자

  • 평가 데이터셋과 기준이 없어 품질 검증을 시작하기 어려운 AI 서비스 개발자

  • 수동 테스트를 자동화하고 배포 전 회귀 테스트를 도입하려는 개발자

  • 실제 업무에 바로 적용할 수 있는 LLM 평가 하네스를 프로젝트로 완성하고 싶은 개발자

안녕하세요
Hong입니다.

인프런인증

커리어인증

10,421

명

수강생

649

개

수강평

171

개

답변

4.8

점

강의 평점

34

개

강의

집에서 빈둥대다 개발에 흥미를 느껴 개발 공부를 시작하였고 현재는 판교에서 플랫폼 서버 개발을 담당하여 진행하고 있습니다. 제가 공부를 했던 방법과 실무에서 접하실 수 있는 여러가지 문제점들과 해결책을 여러분들에게 제공하고 싶어 지식공유자 활동을 이어나가고 있습니다.

 

강의는 오로지 저만의 지식을 통해 만들어지지 않습니다. 모든 강의는 함께하시는 분들이 계십니다.

 

[지식공유자 경력]

[前] 샌드박스IP 관련 블록체인 개발자

[前] 메타버스 백엔드 개발자

[現] 판교에서 고여가는 서버 개발자

 

[인터뷰 이력]

[기타 문의]

[공식 사이트]

더보기

커리큘럼

전체

23개 ∙ (5시간 21분)

해당 강의에서 제공:

수업자료
강의 게시일: 
마지막 업데이트일: 

수강평

전체

5개

4.8

5개의 수강평

  • seha incheon님의 프로필 이미지
    seha incheon

    수강평 3

    ∙

    평균 평점 5.0

    5

    83% 수강 후 작성

    코드 수가 많고 파일도 많다보니깐, 그냥 복사하면서 진행하시는 과정에 있어서 따라가기 힘들다는 느낌이 조금 들었습니다. 그래도 내용이 너무나도 유익하고 생전 처음들어보는 주제라서 이런 단점을 감내할 수 있었던거 같아요. 특히나 평가를 하는 모델도 신뢰 할 수 없으니, 이 모델도 평가를 해야 하는데, 다시 또 모델이 평가하니깐 결국 신뢰가 불가능하다라는 관점으로 이해를 하면서 모델 평가의 결론은 사람이 고생해야 한다로 귀결되는 내용이라고 생각합니다. - 실제로 메타에서도 모델에 과제나 학습시키는데 사람을 더 고용했고 실제 인력을 더 많이 사용한걸로 알고 있는데, 그 관점이 여기서도 반영이 된거같아요.

    • Hong
      지식공유자

      안녕하세요 좋은 평 남겨주셔서 감사합니다!! 아무래도 평가 방식이 너무나도 많고 이걸 하나하나 다 다루기에는 여러분들에게 진입 장벽이 느껴지실까봐 우선적으로 어떤 느낌이고 어떠한 방향성을 가져야 하는지를 중점으로 다루어 보았습니다. 그래서 전반적인 코드의 구조보다는 이런 패턴과 방식을 학습해가시면 좋을꺼같아요!! 앞으로 더 유익한 내용 제공해드리도록 하겠습니다!!

  • 우당탕탕님의 프로필 이미지
    우당탕탕

    수강평 6

    ∙

    평균 평점 5.0

    5

    83% 수강 후 작성

    강의 유익하게 잘 봤습니다!

    • 두쫀쫀쿠님의 프로필 이미지
      두쫀쫀쿠

      수강평 2

      ∙

      평균 평점 5.0

      5

      87% 수강 후 작성

      요약 : AI Agent를 평가하는 방식은 다양하게 있고 그걸 모두 다 적용할 수 있지만, 결국 평가라는 방식은 아직은 사람이 많이 개입을 하고 판단을 내려야 한다. 꽤나 신박한 주제로 잘 봤습니다!!

      • Be Dev님의 프로필 이미지
        Be Dev

        수강평 3

        ∙

        평균 평점 5.0

        5

        91% 수강 후 작성

        Eval이라는 평가 방식을 마스터 한다라기 보다는 "이런 개념들과 이런 검증 패턴들이 있다"정도로 알려주는 내용이라고 생각합니다. 즉 시야를 넓히는데 큰 도움이 된다고 느끼네요. 실제로도 저도 해당 강의를 수강하면서 꽤 신박한 주제라고 생각이 들었으니깐요.

        • Hong
          지식공유자

          안녕하세요 평 남겨주셔서 감사합니다!! 시야 넓히는데 도움이 되었다니 다행이네요!! 아무래도 요즘은 시야를 넓혀서 작업을 해야 하는 시기가 너무나도 중요해진거 같습니다. 앞으로 더 유익한 내용 제공해드리도록 하겠습니다!! 감사합니다!

      • 이광우님의 프로필 이미지
        이광우

        수강평 1

        ∙

        평균 평점 4.0

        4

        100% 수강 후 작성

        Hong님의 다른 강의

        지식공유자님의 다른 강의를 만나보세요!

        비슷한 강의

        같은 분야의 다른 강의를 만나보세요!

        얼리버드 할인 중 (6일 남음)

        ₩5,519

        59%

        ₩108,900