inflearn logo

Thực tiễn đánh giá chất lượng và kiểm thử tác nhân AI: Xác minh hiện tượng bịa đặt, lỗi và hành vi thất bại

AI agent không chỉ đơn thuần tạo ra câu trả lời mà còn gọi nhiều công cụ khác nhau và thực hiện các tác vụ qua nhiều bước. Trong quá trình này, bạn sẽ học theo hướng thực tiễn về cách đánh giá và kiểm thử một cách có hệ thống mọi khía cạnh, từ chất lượng phản hồi của AI agent đến Tool Calling, đường đi thực thi, RAG, lỗi, bảo mật và hiệu năng. Bạn có thể từng bước nắm vững từ cơ bản các phương pháp kiểm định chất lượng cần thiết để xây dựng và vận hành những AI agent đáng tin cậy.

3 học viên đang tham gia khóa học này

Độ khó Cơ bản

Thời gian 12 tháng

Business Productivity
Business Productivity
Service Planning
Service Planning
AI
AI
ChatGPT
ChatGPT
prompt engineering
prompt engineering
Business Productivity
Business Productivity
Service Planning
Service Planning
AI
AI
ChatGPT
ChatGPT
prompt engineering
prompt engineering

Bạn sẽ nhận được điều này sau khi học.

  • Hiểu về chất lượng và cấu trúc kiểm thử AI Agent

  • Tiêu chí đánh giá và thiết kế Test Case

  • Xây dựng Golden Dataset

  • Đánh giá độ chính xác · tính liên quan · độ tin cậy

  • Đánh giá Tool Calling·Trajectory

  • Đánh giá chất lượng tìm kiếm, Context và câu trả lời

  • Kiểm thử lỗi API·Tool·LLM

  • Kiểm thử Prompt Injection · quyền hạn · lộ thông tin

  • Đánh giá tốc độ·Token·chi phí

  • Giám sát · Kiểm thử hồi quy

  • Xây dựng hệ thống QA cho AI Agent doanh nghiệp

Xây dựng AI agent không thất bại: Thực tiễn đánh giá chất lượng và kiểm thử

Đối với AI agent, quy trình xác minh xem chúng có hoạt động đúng cách hay không cũng quan trọng như việc tạo ra chúng.

Trong khóa học này, bạn sẽ học theo hướng thực tiễn cách đánh giá và kiểm thử độ chính xác, độ tin cậy, chất lượng phản hồi, việc gọi công cụ và tính an toàn của các tác nhân AI.

Bạn có thể học một cách hệ thống từ thiết kế kịch bản kiểm thử, phân tích nguyên nhân vấn đề đến các phương pháp cải thiện chất lượng, qua đó phát triển năng lực xây dựng các tác nhân AI đáng tin cậy.

Hãy học thực tiễn về AI agent: xây dựng, đánh giá, kiểm thử và cải tiến.

Khóa học này được khuyến nghị cho những đối tượng sau.


Sau khi hoàn thành khóa học, bạn có thể đạt được những gì?

Đặc điểm của khóa học này

Hãy giới thiệu những đặc điểm nổi bật và điểm khác biệt chính.

3197a356-98e8-4533-bcd2-8953471c4178

Tập trung vào đánh giá chất lượng và kiểm thử chuyên biệt cho tác nhân AI


Cấu trúc tập trung vào thực tiễn, kết nối từ đánh giá đến cải thiện

Bạn sẽ học những nội dung như thế này

Đánh giá chất lượng và thiết kế kiểm thử tác nhân AI

Bạn sẽ học cách thiết kế các hạng mục đánh giá và kịch bản kiểm thử dựa trên độ chính xác, độ tin cậy, chất lượng phản hồi, việc gọi công cụ, tính an toàn, v.v.

Phân tích kết quả kiểm thử và cải thiện chất lượng

Tìm ra nguyên nhân của vấn đề từ kết quả kiểm thử, xác định hướng cải thiện và học cách nâng cao hiệu suất cũng như tính ổn định của tác nhân AI.

Người tạo ra khóa học này

  • Hãy tập trung viết về những lý lịch và kinh nghiệm có liên quan mật thiết đến chủ đề khóa học.

  • Thay vì liệt kê tất cả kinh nghiệm một cách máy móc, bạn nên lồng ghép những trăn trở và động lực đằng sau quá trình tạo ra khóa học này.

  • Hãy thu hút sự chú ý bằng cách kết hợp văn phong súc tích với portfolio, video, hình ảnh, v.v.

Bạn sẽ học được những nội dung này.

Q1. Hiểu về chất lượng và cấu trúc kiểm thử AI Agent
Hiểu toàn bộ cấu trúc về cách xác minh chất lượng của AI Agent theo những tiêu chí và quy trình nào.

Q2. Thiết kế tiêu chí đánh giá và Test Case
Thiết kế các chỉ số đánh giá và test case phù hợp với chức năng cũng như mục đích công việc của Agent.

Q3. Xây dựng Golden Dataset
Xây dựng bộ dữ liệu chuẩn để so sánh khách quan chất lượng câu trả lời của AI Agent.

Q4. Đánh giá độ chính xác, mức độ liên quan và độ tin cậy
Đánh giá xem câu trả lời được tạo ra có chính xác, liên quan đến câu hỏi và đáng tin cậy hay không.

Q5. Đánh giá Tool Calling·Trajectory
Xác minh Agent có chọn công cụ phù hợp và đi đúng quy trình thực thi hay không.

Q6. Đánh giá chất lượng tìm kiếm, Context và câu trả lời
Đánh giá mức độ ảnh hưởng của kết quả tìm kiếm và việc sử dụng Context đến chất lượng câu trả lời cuối cùng.

Q7. Kiểm thử lỗi API·Tool·LLM
Kiểm thử nhiều tình huống sự cố khác nhau như lỗi API, lỗi thực thi Tool và lỗi phản hồi của LLM.

Q8. Kiểm thử Prompt Injection, quyền hạn và lộ lọt thông tin
Kiểm tra các rủi ro bảo mật như tấn công prompt, sử dụng quyền hạn quá mức và lộ thông tin nhạy cảm.

Q9. Đánh giá tốc độ·Token·chi phí
Đo lường tốc độ phản hồi, lượng Token sử dụng, chi phí API, v.v. để đánh giá hiệu quả vận hành.

Q10. Giám sát · Kiểm thử hồi quy
Liên tục theo dõi những thay đổi về chất lượng trong quá trình vận hành và kiểm tra xem các chức năng hiện có có gặp bất thường sau khi cập nhật hay không.

Q11. Xây dựng hệ thống QA cho AI Agent doanh nghiệp
Xây dựng quy trình QA dành cho doanh nghiệp, có thể kiểm chứng chất lượng lặp lại trong toàn bộ quá trình từ lập kế hoạch, phát triển, triển khai đến vận hành.

Lưu ý trước khi tham gia khóa học

Môi trường thực hành

  • Hệ điều hành và phiên bản (OS): Các loại và phiên bản hệ điều hành như Windows, macOS, Linux, Ubuntu, Android, iOS, v.v.

  • Công cụ sử dụng: phiên bản và gói tính phí của phần mềm/phần cứng cần thiết cho thực hành, có sử dụng máy ảo hay không, v.v.

  • Thông số PC: CPU, bộ nhớ, ổ đĩa, card đồ họa và các thông số khuyến nghị để chạy chương trình, v.v.

Tài liệu học tập

  • Định dạng tài liệu học tập được cung cấp (PPT, liên kết đám mây, văn bản, mã nguồn, tài sản, chương trình, bài tập mẫu, v.v.)

  • Số lượng và dung lượng, các đặc điểm và lưu ý khác về tài liệu học tập, v.v.

Kiến thức tiên quyết và lưu ý

  • Mức độ cần thiết của kiến thức nền tảng bắt buộc, có cân nhắc đến độ khó của việc học tập

  • Chất lượng video bài giảng (âm thanh/hình ảnh) và các nội dung liên quan trực tiếp đến việc học, cũng như phương pháp học được khuyến nghị

  • Nội dung liên quan đến câu hỏi/trả lời và các cập nhật sau này

  • Thông báo liên quan đến bản quyền bài giảng và tài liệu học tập

Khuyến nghị cho
những người này

Khóa học này dành cho ai?

  • Nhà phát triển tác nhân AI và người phụ trách phát triển dịch vụ

  • Nhân viên QA·phụ trách kiểm thử phần mềm

  • Nhân viên phụ trách lập kế hoạch, vận hành dịch vụ AI và bảo mật

Cần biết trước khi bắt đầu?

  • Hiểu biết cơ bản về AI tạo sinh và LLM

  • Hiểu cấu trúc cơ bản của tác nhân AI

  • Khái niệm cơ bản về kiểm thử phần mềm

Xin chào
Đây là 88888

494

Học viên

94

Đánh giá

4.6

Xếp hạng

32

Các khóa học

Xin chào.

Tôi là Thám tử Byte.

Cho đến nay, tôi đã làm việc hơn 24 năm trong lĩnh vực AI và CNTT, phụ trách các công việc liên quan đến chiến lược CNTT và an ninh thông tin. Hiện tại, tôi đang sản xuất và phát triển nội dung học trực tuyến cần thiết trong thời đại AI, hoạt động với tư cách giảng viên bên ngoài (chẳng hạn như tại Multicampus), đồng thời tư vấn về AI và CNTT cho các doanh nghiệp vừa và nhỏ.

Dựa trên những bí quyết thực tế trong công việc này, hãy nâng cao kiến thức và kỹ năng của mình thông qua những bài giảng dễ hiểu, thú vị và mạch lạc, đồng thời mang lại hiệu quả thiết thực trong công việc.

Kênh YouTube: https://www.youtube.com/@신동주-s1b

Thêm

Chương trình giảng dạy

Tất cả

25 bài giảng ∙ (10giờ 9phút)

Tài liệu khóa học:

Tài liệu bài giảng
Ngày đăng: 
Cập nhật lần cuối: 

Đánh giá

Chưa có đủ đánh giá.
Hãy trở thành tác giả của một đánh giá giúp mọi người!

Khóa học khác của 88888

Hãy khám phá các khóa học khác của giảng viên!

Khóa học tương tự

Khám phá các khóa học khác trong cùng lĩnh vực!

Ưu đãi có thời hạn

59.400 ₫

40%

2.059.443 ₫