Kỹ thuật xây dựng harness đánh giá LLM do một nhà phát triển ở Thung lũng Silicon hướng dẫn

Nếu bạn từng gặp khó khăn trong việc xác định liệu chất lượng câu trả lời có giảm so với trước hay không sau khi thay đổi prompt hoặc mô hình trong quá trình xây dựng dịch vụ sử dụng LLM, khóa học này có thể là giải pháp dành cho bạn. Bạn sẽ học cách tự xây dựng tiêu chí đánh giá và tự động tìm ra những câu trả lời đã thay đổi.

(4.9) 9 đánh giá

134 học viên

Độ khó Cơ bản

Thời gian Không giới hạn

JavaScript
JavaScript
TypeScript
TypeScript
Business Productivity
Business Productivity
AI
AI
ChatGPT
ChatGPT
JavaScript
JavaScript
TypeScript
TypeScript
Business Productivity
Business Productivity
AI
AI
ChatGPT
ChatGPT

Đánh giá từ những học viên đầu tiên

4.9

5.0

Be Dev

91% đã tham gia

Tôi nghĩ nội dung này không hẳn là giúp bạn làm chủ phương pháp đánh giá mang tên Eval, mà đúng hơn là giới thiệu ở mức “có những khái niệm và những mẫu kiểm chứng như thế này”. Nói cách khác, tôi cảm thấy nó giúp mở rộng tầm nhìn rất nhiều. Thực tế, trong quá trình học khóa học này, tôi cũng cảm thấy đây là một chủ đề khá mới mẻ và thú vị.

5.0

seha incheon

83% đã tham gia

Vì số lượng code nhiều và file cũng nhiều, nên trong quá trình vừa sao chép vừa thực hiện, tôi có cảm giác hơi khó theo kịp. Tuy vậy, nội dung quá hữu ích và lại là một chủ đề mà tôi chưa từng nghe đến trong đời, nên có lẽ tôi vẫn có thể chấp nhận được những điểm hạn chế này. Đặc biệt, vì không thể tin tưởng hoàn toàn vào cả mô hình dùng để đánh giá, nên ngay cả mô hình này cũng cần phải được đánh giá. Nhưng rồi lại để mô hình đánh giá, vì vậy tôi hiểu vấn đề theo hướng cuối cùng là không thể tin tưởng được. Tôi nghĩ kết luận của việc đánh giá mô hình là con người vẫn phải vất vả. - Thực tế, tôi được biết Meta cũng đã thuê thêm người để giao nhiệm vụ hoặc huấn luyện mô hình, đồng thời sử dụng nhiều nhân lực hơn, và có vẻ góc nhìn đó cũng được phản ánh ở đây.

5.0

GoHome

100% đã tham gia

Tôi đã tự xây dựng và sử dụng rubric để đánh giá kết quả LLM, nên rất vui vì qua khóa học này tôi có thể hiểu một cách có hệ thống hơn về phương pháp mình vẫn sử dụng trước đây. Không chỉ rubric, khóa học còn giúp tôi nắm được toàn bộ quy trình đánh giá LLM, bao gồm LLM Judge, tập dữ liệu đánh giá và kiểm thử hồi quy, chỉ trong một lần. Đồng thời, khóa học cũng giúp tôi định hướng cách phát triển phương pháp đánh giá đang được sử dụng trong thực tế. Ngay cả những người đang sử dụng LLM trong công việc hoặc đã tự xây dựng và áp dụng các tiêu chí đánh giá riêng cũng sẽ nhận được nhiều điều hữu ích nếu tham gia khóa học với góc nhìn hệ thống hóa và bổ sung cho phương pháp hiện có.

Bạn sẽ nhận được điều này sau khi học.

  • Triển khai công cụ thu thập và đánh giá định lượng·định tính các phản hồi của LLM

  • Xác minh sự khác biệt về chất lượng trước và sau khi thay đổi prompt và mô hình bằng kiểm thử hồi quy

  • Cách thiết kế tập dữ liệu đánh giá và tiêu chí đánh giá LLM rõ ràng

  • Xây dựng quy trình đánh giá đáng tin cậy bằng cách kết hợp LLM Judge và đánh giá dựa trên quy tắc

  • Theo dõi các phản hồi thất bại để phân tích nguyên nhân vấn đề nằm ở prompt, tìm kiếm hay mô hình

  • Kết nối kết quả đánh giá với CI/CD để liên tục quản lý chất lượng dịch vụ LLM

Khuyến nghị cho
những người này

Khóa học này dành cho ai?

  • Nhà phát triển vận hành dịch vụ LLM và cần xác minh tác động của những thay đổi về prompt và mô hình.

  • Nhà phát triển muốn đánh giá một cách có hệ thống chất lượng câu trả lời của dịch vụ LLM Agent và RAG

  • Nhà phát triển dịch vụ AI gặp khó khăn khi bắt đầu kiểm định chất lượng vì không có tập dữ liệu và tiêu chuẩn đánh giá

  • Nhà phát triển muốn tự động hóa kiểm thử thủ công và triển khai kiểm thử hồi quy trước khi phát hành

  • Nhà phát triển muốn hoàn thiện thành một dự án bộ khung đánh giá LLM có thể áp dụng ngay vào công việc thực tế

Xin chào
Đây là Hong

Xác minh Inflearn

Xác minh sự nghiệp

10,132

Học viên

603

Đánh giá

175

Trả lời

4.8

Xếp hạng

30

Các khóa học

Tôi bắt đầu học lập trình sau một thời gian dài lười biếng ở nhà và cảm thấy hứng thú với nó, hiện tại tôi đang đảm nhận việc phát triển máy chủ nền tảng (platform server) tại Pangyo. Tôi tiếp tục hoạt động với tư cách là người chia sẻ kiến thức vì muốn cung cấp cho các bạn phương pháp tôi đã học cũng như những vấn đề và giải pháp khác nhau mà các bạn có thể gặp phải trong thực tế.

 

Bài giảng không chỉ được tạo ra từ kiến thức của riêng tôi. Mọi bài giảng đều có sự đồng hành của những người cộng sự.

 

[Kinh nghiệm của người chia sẻ kiến thức]

[Cựu] Nhà phát triển blockchain liên quan đến Sandbox IP

[Cựu] Nhà phát triển Backend Metaverse

[Hiện tại] Nhà phát triển server đang làm việc lâu năm tại Pangyo

 

[Lịch sử phỏng vấn]

[Yêu cầu khác]

[Trang web chính thức]

Thêm

Chương trình giảng dạy

Tất cả

23 bài giảng ∙ (5giờ 21phút)

Tài liệu khóa học:

Tài liệu bài giảng
Ngày đăng: 
Cập nhật lần cuối: 

Đánh giá

Tất cả

9 đánh giá

4.9

9 đánh giá

  • lookupjoin님의 프로필 이미지
    lookupjoin

    Đánh giá 3

    ∙

    Đánh giá trung bình 5.0

    5

    91% đã tham gia

    Tôi nghĩ nội dung này không hẳn là giúp bạn làm chủ phương pháp đánh giá mang tên Eval, mà đúng hơn là giới thiệu ở mức “có những khái niệm và những mẫu kiểm chứng như thế này”. Nói cách khác, tôi cảm thấy nó giúp mở rộng tầm nhìn rất nhiều. Thực tế, trong quá trình học khóa học này, tôi cũng cảm thấy đây là một chủ đề khá mới mẻ và thú vị.

    • jhong
      Giảng viên

      Xin chào, cảm ơn bạn đã để lại đánh giá!! Thật mừng vì nội dung này đã giúp bạn mở rộng tầm nhìn!! Có lẽ trong thời đại ngày nay, việc mở rộng tầm nhìn khi làm việc đã trở nên vô cùng quan trọng. Tôi sẽ cố gắng cung cấp những nội dung hữu ích hơn nữa trong thời gian tới!! Xin cảm ơn!

  • gohome님의 프로필 이미지
    gohome

    Đánh giá 28

    ∙

    Đánh giá trung bình 4.8

    5

    100% đã tham gia

    Tôi đã tự xây dựng và sử dụng rubric để đánh giá kết quả LLM, nên rất vui vì qua khóa học này tôi có thể hiểu một cách có hệ thống hơn về phương pháp mình vẫn sử dụng trước đây. Không chỉ rubric, khóa học còn giúp tôi nắm được toàn bộ quy trình đánh giá LLM, bao gồm LLM Judge, tập dữ liệu đánh giá và kiểm thử hồi quy, chỉ trong một lần. Đồng thời, khóa học cũng giúp tôi định hướng cách phát triển phương pháp đánh giá đang được sử dụng trong thực tế. Ngay cả những người đang sử dụng LLM trong công việc hoặc đã tự xây dựng và áp dụng các tiêu chí đánh giá riêng cũng sẽ nhận được nhiều điều hữu ích nếu tham gia khóa học với góc nhìn hệ thống hóa và bổ sung cho phương pháp hiện có.

    • jhong
      Giảng viên

      Cảm ơn bạn đã để lại đánh giá tốt. Như bạn đã đề cập, video được thực hiện với mục tiêu giúp người xem có cái nhìn tổng quan về các mẫu hình thường được sử dụng trong đánh giá LLM dưới góc độ thực tiễn!! Dạo này thời tiết lạnh hơn nhiều rồi ㅠㅠ Bạn nhớ giữ gìn sức khỏe và chúc bạn một ngày tốt lành!

  • hae1on917님의 프로필 이미지
    hae1on917

    Đánh giá 13

    ∙

    Đánh giá trung bình 4.3

    5

    87% đã tham gia

    Bài giảng xuất sắc đã hệ thống hóa việc kiểm soát chất lượng LLM vốn phụ thuộc vào cảm tính bằng các con số và mã nguồn Trong quá trình phát triển dịch vụ LLM, mỗi khi thay đổi prompt hoặc mô hình, tôi luôn trăn trở vì khó xác minh rõ ràng “chất lượng câu trả lời thực sự đã được cải thiện hay chỉ phát sinh lỗi ở một khía cạnh khác”. Khóa học này không chỉ dừng lại ở việc gọi API đơn thuần mà còn trình bày một cách có hệ thống, từng bước, từ chấm điểm dựa trên quy tắc, LLM-as-a-Judge, phòng tránh thiên kiến (Bias) cho đến xây dựng quy trình kiểm thử hồi quy trước khi triển khai. Đặc biệt, nhờ quá trình trực tiếp triển khai một evaluation harness từ đầu trong môi trường cục bộ mà không phụ thuộc vào API trả phí bên ngoài hay framework cồng kềnh, tôi đã có thể hiểu chắc chắn các nguyên lý. Tôi rất khuyến nghị đây là khóa học thiết yếu dành cho các kỹ sư muốn triển khai và vận hành ổn định các tính năng LLM ở cấp độ production.

    • sehaincheon1507님의 프로필 이미지
      sehaincheon1507

      Đánh giá 3

      ∙

      Đánh giá trung bình 5.0

      5

      83% đã tham gia

      Vì số lượng code nhiều và file cũng nhiều, nên trong quá trình vừa sao chép vừa thực hiện, tôi có cảm giác hơi khó theo kịp. Tuy vậy, nội dung quá hữu ích và lại là một chủ đề mà tôi chưa từng nghe đến trong đời, nên có lẽ tôi vẫn có thể chấp nhận được những điểm hạn chế này. Đặc biệt, vì không thể tin tưởng hoàn toàn vào cả mô hình dùng để đánh giá, nên ngay cả mô hình này cũng cần phải được đánh giá. Nhưng rồi lại để mô hình đánh giá, vì vậy tôi hiểu vấn đề theo hướng cuối cùng là không thể tin tưởng được. Tôi nghĩ kết luận của việc đánh giá mô hình là con người vẫn phải vất vả. - Thực tế, tôi được biết Meta cũng đã thuê thêm người để giao nhiệm vụ hoặc huấn luyện mô hình, đồng thời sử dụng nhiều nhân lực hơn, và có vẻ góc nhìn đó cũng được phản ánh ở đây.

      • jhong
        Giảng viên

        Xin chào, cảm ơn bạn vì đã để lại nhận xét tích cực!! Vì có quá nhiều phương pháp đánh giá khác nhau và nếu đề cập đến từng phương pháp một thì có thể sẽ khiến các bạn cảm thấy khó tiếp cận, nên trước tiên tôi đã tập trung trình bày về cảm giác tổng thể cũng như định hướng cần có. Vì vậy, thay vì tập trung vào cấu trúc tổng thể của mã nguồn, tôi nghĩ các bạn nên học hỏi những mẫu và phương pháp này!! Trong thời gian tới, tôi sẽ tiếp tục cung cấp những nội dung hữu ích hơn nữa!!

    • koelkorea7927님의 프로필 이미지
      koelkorea7927

      Đánh giá 27

      ∙

      Đánh giá trung bình 5.0

      Đã chỉnh sửa

      5

      13% đã tham gia

      Tôi nghĩ đây là một bài giảng hay, mang đến những kiến thức hoặc gợi mở có ý nghĩa về mặt kỹ thuật một cách đúng trọng tâm, như cơn mưa đúng lúc giữa hạn hán, dành cho những người làm trong các lĩnh vực khác chứ không trực tiếp phát triển hay nghiên cứu mô hình. Ngày nay, những điều như tính không tất định trong đầu ra của LLM đã là sự thật được biết đến rộng rãi. Tuy nhiên, những nội dung cụ thể liên quan đến việc đánh giá giá trị và độ chính xác của các đầu ra không tất định đó—chẳng hạn như hộp đen được xây dựng theo cách nào, con người nên tiếp cận và điều chỉnh các giá trị cài đặt ra sao, cũng như phải đánh giá kết quả sau khi thay đổi như thế nào—lại không dễ tìm hiểu. Vì vậy, tôi cho rằng một chủ đề khai thác tốt những khía cạnh này là nội dung khá có ý nghĩa ở thời điểm hiện tại.

      Khóa học khác của Hong

      Hãy khám phá các khóa học khác của giảng viên!

      Khóa học tương tự

      Khám phá các khóa học khác trong cùng lĩnh vực!

      Ưu đãi có thời hạn, kết thúc sau 20:48:43 ngày

      912.689 ₫

      59%

      2.267.001 ₫