강의

멘토링

로드맵

Red Team AI 2 - Nguyên lý hoạt động và bề mặt tấn công của LLM

Trước khi học thuộc các kỹ thuật tấn công, tôi sẽ tìm hiểu vì sao LLM lại thất bại theo cách đó, chỉ ở mức mà kẻ tấn công cần biết về token, ngữ cảnh, system prompt, RAG, tác nhân và guardrail, rồi áp dụng vào mã backend của mình để lập bản đồ bề mặt tấn công.

2 học viên đang tham gia khóa học này

Độ khó Nhập môn

Thời gian Không giới hạn

AI
AI
prompt engineering
prompt engineering
LLM
LLM
Offensive Security
Offensive Security
RAG
RAG
AI
AI
prompt engineering
prompt engineering
LLM
LLM
Offensive Security
Offensive Security
RAG
RAG

Bạn sẽ nhận được điều này sau khi học.

  • Giải thích tại sao việc mô hình nhìn thấy token chứ không phải ký tự khiến không thể xem bộ lọc đầu vào là một biện pháp kiểm soát.

  • Mô tả cấu trúc trong đó prompt hệ thống, các cuộc trò chuyện trước đây, tài liệu tìm kiếm và nội dung nhập của người dùng được nối tiếp thành một dòng trong cửa sổ ngữ cảnh.

  • Xác định trong ba giai đoạn lập chỉ mục, tìm kiếm và chèn của RAG đâu mới thực sự là bề mặt tấn công.

  • Chúng ta biết vòng lặp bốn bước trong đó tác nhân gọi công cụ, cũng như lúc đó nó hoạt động dưới quyền hạn của ai.

  • Phân biệt 5 tầng kiểm soát mà dịch vụ thực tế sử dụng có thể ngăn chặn điều gì và không thể ngăn chặn điều gì.

  • Hãy kiểm tra bằng bảng đối chiếu xem cấu trúc này được thể hiện như thế nào trong dòng gọi `converse` của app.py đã đăng ở phần Cơ bản 1.

  • Tôi lập bản đồ bốn lớp về bề mặt tấn công của dịch vụ AI mà tôi sử dụng (Nhiệm vụ 1)

Tại sao lại là khóa học này?

Có những câu hỏi mà dù đọc hai mươi trường hợp prompt injection vẫn không tìm ra được câu trả lời: Vì sao không bị chặn bởi bộ lọc đầu vào, vì sao system prompt có ghi 「Đừng cho xem」 lại bị lộ ra ngoài, vì sao chỉ một tài liệu được tìm kiếm cũng có thể thay đổi hành vi của mô hình.

Không thể tìm ra câu trả lời chỉ bằng cách học thuộc các kỹ thuật. Muốn có câu trả lời, cần hiểu mô hình tiếp nhận đầu vào như thế nào.

Bài giảng này chỉ xem xét nguyên lý đó ở mức đủ để kẻ tấn công cần biết. Chúng tôi sẽ giải thích bằng một hình minh họa duy nhất, rồi áp dụng trực tiếp vào app.py của backend mà các bạn đã triển khai ở phần Cơ bản 1 để xác định dòng nào tương ứng với phần nào trong hình, sau đó vẽ bản đồ bề mặt tấn công của dịch vụ AI mà các bạn thực sự đang sử dụng.

Sau khi hoàn thành khóa học này, bạn sẽ có thể làm được những điều sau

  • Giải thích tại sao việc mô hình nhìn thấy token chứ không phải ký tự khiến không thể xem bộ lọc đầu vào là một biện pháp kiểm soát.

  • Mô tả cấu trúc trong đó prompt hệ thống, các cuộc trò chuyện trước đây, tài liệu tìm kiếm và nội dung nhập của người dùng được nối tiếp thành một dòng trong cửa sổ ngữ cảnh.

  • Xác định trong ba giai đoạn lập chỉ mục, tìm kiếm và chèn của RAG đâu là bề mặt tấn công, cũng như khi tác nhân gọi công cụ thì nó hoạt động với quyền hạn của ai.

  • Phân biệt 5 tầng kiểm soát mà dịch vụ thực tế sử dụng có thể ngăn chặn điều gì và không thể ngăn chặn điều gì.

  • Hãy kiểm tra bằng bảng đối chiếu xem cấu trúc này được thể hiện như thế nào trong dòng gọi `converse` của app.py đã đăng ở phần Cơ bản 1.

  • Tôi lập bản đồ bốn lớp về bề mặt tấn công của dịch vụ AI mà tôi sử dụng (Nhiệm vụ 1)

Khóa học này phù hợp với những người như vậy

  • Học viên đã hoàn thành Cơ bản 1 và đã triển khai backend thực hành

  • Các nhà phát triển và nhân viên bảo mật muốn tìm hiểu từ nguyên lý tại sao prompt injection về cơ bản không thể bị ngăn chặn triệt để

  • Nhà hoạch định·PM muốn tóm tắt trên một trang những rủi ro phát sinh khi triển khai LLM·RAG·agent

Có thể không phù hợp với những người như sau

  • Những người muốn học về thuật toán token hóa hoặc các công thức Transformer - Không có toán học trong khóa học này.

  • Những người mong đợi các bài thực hành viết mã – ở bài 2-6, bạn chỉ đọc app.py chứ không viết mã lệnh.

  • Những người muốn trực tiếp tấn công trong khóa học này - phần thực hành xâm nhập bắt đầu từ bài 4 (Trung cấp 1), còn ở đây chúng ta sẽ xem lý do tại sao có thể bị xâm nhập

  • Những người đã bỏ qua nhiệm vụ 0 của Cơ bản 1 (triển khai backend thực hành) – các buổi 2–6 sẽ mở mã đó.

Mạch bài giảng - Nguyên lý → Áp dụng vào mã của tôi → Bản đồ bề mặt tấn công

Tổng cộng 8 bài · 55 phút. Thứ tự các phần chính là thứ tự học.

  • Phần 1 · Giới thiệu bài giảng (1 bài · 2 phút · 1 bài xem trước)

  • Phần 2 · LLM tiếp nhận đầu vào như thế nào (5 bài · 38 phút · 1 bài xem trước)

  • Phần 3 · Áp dụng vào mã back-end của tôi và lập bản đồ bề mặt tấn công (2 bài · 14 phút · xem trước 1 bài)

Những điều cần kiểm tra trước khi học

  • Giả định bạn đã hoàn thành Nhiệm vụ 0 của Cơ bản 1.

  • Khóa học này hầu như không phát sinh thêm chi phí AWS vì không thao tác trên console. Ở buổi 2-6, chúng ta chỉ đọc mã backend.

  • Đây là bài giảng tập trung vào trình duyệt và không cần cài đặt gì trên máy tính cá nhân của tôi.

  • Phần thuyết minh là giọng nói TTS.

Chi tiết nội dung bài giảng

▶ Vị trí hình ảnh · basic2-01-context.png - Cửa sổ ngữ cảnh - Tất cả được nối liền thành một dòng duy nhất

LLM tiếp nhận đầu vào như thế nào?

Mô hình không nhìn thấy chữ mà nhìn các mảnh gọi là token, trong đó prompt hệ thống, cuộc trò chuyện trước đó, tài liệu được tìm kiếm và đầu vào của người dùng đều được nối liên tiếp thành một dòng trong cửa sổ ngữ cảnh. Hình minh họa này là phần quan trọng nhất của bài giảng, bởi vì phần lớn các cuộc tấn công được trình bày sau đó đều bắt nguồn từ việc không có dấu hiệu phân định ranh giới.

Tiếp theo, chúng ta lần lượt xem xét lý do system prompt là một lời đề nghị chứ không phải quy tắc, trong ba bước RAG cắt, tìm kiếm và chèn tài liệu thì đâu là bề mặt tấn công, cũng như khi agent gọi công cụ thì nó hoạt động với quyền hạn của ai; sau đó đi sâu vào việc 5 lớp kiểm soát được các dịch vụ thực tế sử dụng ngăn chặn được những gì và không thể ngăn chặn được những gì.

▶ Vị trí hình ảnh · basic2-02-guardrail.png - 5 lớp kiểm soát được dịch vụ thực tế sử dụng

▶ Vị trí hình ảnh minh họa · basic2-04-backend.png - Bốn ô trong sơ đồ cấu hình và ba đường dẫn trong app.py

Áp dụng vào mã back-end của tôi và vẽ bản đồ bề mặt tấn công

Không chỉ dừng lại ở hình vẽ. Ở buổi 2-6, chúng ta sẽ mở app.py của backend mà các bạn đã đưa lên trong phần Cơ bản 1 và đối chiếu bằng bảng xem system·messages·tools được đưa vào như thế nào trong một dòng gọi converse. Lúc này, các bạn sẽ thấy những hình vẽ trong bài giảng nằm ở đâu trong mã của tài khoản mình, cũng như tầng kiểm soát nào đang bị bỏ trống. Ở buổi cuối, chúng ta sẽ hệ thống hóa những gì đã xem thành bản đồ bốn tầng, rồi dùng Nhiệm vụ 1 để thử vẽ bề mặt tấn công của dịch vụ AI mà các bạn thực sự đang sử dụng. Bản đồ này sẽ trở thành bản phác thảo nền tảng cho ranh giới tin cậy mà các bạn sẽ vẽ trong phần Cơ bản 3.

▶ Vị trí hình ảnh · basic2-03-map.png - Bản đồ bốn tầng (Nhiệm vụ 1)

Không có toán học và cũng không viết mã. Vì không cần thao tác trên bảng điều khiển nên bài giảng này hầu như không phát sinh chi phí AWS. Bài giảng giả định bạn đã hoàn thành Nhiệm vụ 0 của Cơ bản 1; nếu đã xóa ngăn xếp thì chỉ mất 5 phút để triển khai lại.

Cấu trúc và phương pháp học tập

Cấu trúc gồm 8 bài, tổng cộng 55 phút, ngắn nhất trong 7 bài học. Mỗi bài kéo dài từ 6 đến 8 phút và đều được giảng bằng cách trình bày một hình minh họa duy nhất, vì vậy bạn có thể nghe sáu bài về khái niệm khi đang di chuyển, còn 2-6 Gán mã và 2-7 Nhiệm vụ 1 thì chỉ cần xem trước màn hình. Ở slide tổng kết cuối mỗi bài, hình minh họa và một câu của bài đó sẽ được trình bày lại, nên sau này khi gặp khó ở phần trung cấp, chỉ cần mở lại những slide đó là đủ.

Nhiệm vụ 1 là chọn một dịch vụ AI mà bạn thực sự sử dụng, không cần định dạng, và vẽ bản đồ bốn tầng của dịch vụ đó. Nếu bạn không biết nên chọn dịch vụ nào, chỉ cần ghi tên dịch vụ trên bảng hỏi đáp, chúng tôi sẽ giúp bạn định hướng.

Bài giảng tiếp theo

Ở bài giảng tiếp theo, Bài cơ bản 3, trước khi tấn công một cách mù quáng, bạn sẽ học trình tự công việc mà đội red team thực tế thực hiện, đó là xác định phạm vi, kiểm kê tài sản và vẽ mô hình mối đe dọa; sau đó phát triển bản đồ bề mặt tấn công đã vẽ ở đây thành tài liệu mô hình mối đe dọa.

Đặc điểm của khóa học

  • Giải thích bằng nguyên lý câu “90 phần trăm được tuân thủ và điều nhất định phải được tuân thủ là hai việc khác nhau”.

  • Hình vẽ → mã của tài khoản của tôi → bản đồ bề mặt tấn công, lần lượt đi từ khái quát xuống hiện vật.

  • Chỉ ra từ góc độ thực tiễn cần kiểm tra ở đâu đối với những thành phần dễ bị bỏ sót trong danh mục tài sản như cơ sở dữ liệu vector.

  • Đây là bài ngắn nhất trong 7 bài, bạn có thể hoàn thành trong một ngày.

  • Lĩnh vực đề cập - bảo mật trí tuệ nhân tạo (AI), nguyên lý hoạt động của LLM, bề mặt tấn công dưới góc độ kỹ thuật prompt, cấu trúc RAG và AI Agent (tác tử), an ninh tấn công.

Sau khi hoàn thành khóa học

Sau khi hoàn thành khóa học, bạn có thể giải thích bằng nguyên lý câu nói: 「Được bảo vệ 90% và được bảo vệ tuyệt đối là hai chuyện khác nhau」, đồng thời tự tay xây dựng được bản đồ bề mặt tấn công của một dịch vụ AI mà bạn đang sử dụng. Bản đồ này sẽ phát triển thành tài liệu mô hình hóa mối đe dọa ở phần Cơ bản 3.

Series “Tự mình đột phá AI Red Teaming” – Bài 7

  • AI Red Teaming 1 - Nhập môn bảo mật LLM và môi trường thực hành

  • AI Red Teaming 2 - Nguyên lý hoạt động của LLM và bề mặt tấn công ← Bài giảng này

  • AI Red Team 3 - Công việc của đội Red Team và mô hình hóa mối đe dọa

  • AI Red Teaming 4 - Trực tiếp vượt qua Prompt Injection

  • AI Red Teaming 5 - Một thiết lập bị thiếu mở ra cuộc tấn công

  • AI Red Teaming 6 - Xâm nhập tác nhân và RAG

  • AI Red Teaming 7 - Thiết kế kiểm soát và báo cáo red team

Các sản phẩm đầu ra của nhiệm vụ trong bài giảng trước sẽ trở thành nguyên liệu cho bài giảng sau, nên được công bố theo thứ tự số; các bài giảng chưa phát hành sẽ được công bố lần lượt.

Khuyến nghị cho
những người này

Khóa học này dành cho ai?

  • Học viên đã hoàn thành Cơ bản 1 và đã triển khai backend thực hành

  • Các nhà phát triển và nhân viên bảo mật muốn tìm hiểu từ nguyên lý tại sao prompt injection về cơ bản không thể bị ngăn chặn triệt để

  • Nhà hoạch định·PM muốn tóm tắt trên một trang những rủi ro phát sinh khi triển khai LLM·RAG·agent

Cần biết trước khi bắt đầu?

  • Giả định bạn đã hoàn thành Nhiệm vụ 0 của Cơ bản 1 (triển khai backend thực hành và chụp lại truy vấn đầu tiên). Nếu bạn đã xóa stack, chỉ cần chạy một dòng `deploy.sh` trong CloudShell, hệ thống sẽ được dựng lại trong 5 phút. Không yêu cầu làm toán hay viết mã.

Xin chào
Đây là rmsxodxod1289

Xác minh sự nghiệp

Tôi là một chuyên viên thực tiễn, bắt đầu từ kiểm thử xâm nhập và xây dựng hệ thống quản lý an toàn thông tin.

Phụ trách đánh giá bảo mật hằng năm cho các nhà sản xuất ô tô hoàn chỉnh và doanh nghiệp năng lượng, bao gồm hạ tầng, web và ứng dụng.

Tôi đã đánh giá theo từng tầng và thực hiện chứng nhận ISMS-P của cùng một khách hàng qua ba lần: lần đầu, lần đánh giá sau chứng nhận và lần gia hạn.

Tôi đã tự mình thực hiện toàn bộ các biện pháp bảo vệ kỹ thuật để ứng phó.

Hiện tại, với tư cách là người phụ trách bảo vệ thông tin duy nhất trong tổ chức, tôi đang chuẩn bị đạt chứng nhận lần đầu, đồng thời triển khai quản trị an ninh AI

Tôi đang thiết kế một hệ thống. Vì đây là lĩnh vực mà các tiêu chuẩn vẫn đang được hình thành, nên bắt đầu từ việc định nghĩa các đối tượng kiểm soát񎟋

Đây là vị trí mà tôi phải trực tiếp xây dựng từ đầu.

Sở hữu các chứng chỉ Kỹ sư Bảo mật Thông tin, CPPG và đánh giá viên ISO/IEC 27001, đồng thời theo học tại Đại học Dongguk về Bảo vệ Thông tin Quốc tế.

Tôi nghiên cứu các con đường rò rỉ trong môi trường AI và đối chiếu các tiêu chuẩn chứng nhận tại Khoa An ninh Trí tuệ nhân tạo của trường cao học.

Kinh nghiệm 5 năm 9 tháng. Tên khách hàng và các lỗ hổng thực tế đã phát hiện thuộc phạm vi bảo mật nên trong các buổi giảng dạy】【。

Không đề cập trong bài giảng vì tên khách hàng và các lỗ hổng thực tế được phát hiện thuộc diện bảo mật.

Đánh giá

Chưa có đủ đánh giá.
Hãy trở thành tác giả của một đánh giá giúp mọi người!

Khóa học tương tự

Khám phá các khóa học khác trong cùng lĩnh vực!