강의

멘토링

로드맵

AIレッドチーミング2 - LLMの動作原理と攻撃対象領域

攻撃手法を暗記する前に、LLMがなぜそのように失敗するのかを、攻撃者が知っておくべき範囲に絞って、トークン・コンテキスト・システムプロンプト・RAG・エージェント・ガードレールの観点から学び、自分のバックエンドコードに当てはめて攻撃対象領域のマップを作成します。

2名 が受講中です。

難易度 入門

受講期間 無制限

AI
AI
prompt engineering
prompt engineering
LLM
LLM
Offensive Security
Offensive Security
RAG
RAG
AI
AI
prompt engineering
prompt engineering
LLM
LLM
Offensive Security
Offensive Security
RAG
RAG

受講後に得られること

  • モデルが文字ではなくトークンを見ているという事実が、なぜ入力フィルターを制御とみなせなくするのかを説明します

  • システムプロンプト・過去の会話・検索文書・ユーザー入力がコンテキストウィンドウ内で一続きに連結される構造を描きます

  • RAGの索引・検索・注入の3段階のうち、どこが本当の攻撃面なのかを指摘します

  • エージェントがツールを呼び出す4段階のループと、その際に誰の権限で動作するのかを知っています。

  • 実際のサービスで使われている5層の統制が、何を阻止でき、何を阻止できないのかを区別します。

  • 基礎1で掲載した app.py の converse 呼び出し1行に、この構造がどのように組み込まれているかを対応表で確認します。

  • 私が使うAIサービスの攻撃対象領域を、4層マップとして描きます(ミッション1)

なぜこの講義なのか

プロンプトインジェクションの事例を20個読んでも答えが出ない疑問があります。なぜ入力フィルターで防げないのか、なぜ「見せるな」と書かれたシステムプロンプトが外に出てくるのか、なぜ検索文書1枚がモデルの挙動を変えるのか。

手法を暗記するだけでは答えは出ません。モデルが入力をどのように受け取るのかを理解してこそ、答えが出ます。

この講義では、攻撃者が知っておくべき範囲に絞って、その原理を見ていきます。1枚の図で説明し、基礎1で作成した皆さんのバックエンドのapp.pyにそのまま当てはめて、どの行がどの図に該当するのかを確認したうえで、皆さんが実際に利用しているAIサービスの攻撃対象領域マップを描きます。

この講義を終えるとできること

  • モデルが文字ではなくトークンを見ているという事実が、なぜ入力フィルターを制御とみなせなくするのかを説明します

  • システムプロンプト・過去の会話・検索文書・ユーザー入力がコンテキストウィンドウ内で一続きに連結される構造を描きます

  • RAGのインデックス化・検索・注入の3段階のうち、どこが攻撃対象領域なのか、エージェントがツールを呼び出す際に誰の権限で動作するのかを確認します

  • 実際のサービスで使われている5層の統制が、何を阻止でき、何を阻止できないのかを区別します。

  • 基礎1で掲載した app.py の converse 呼び出し1行に、この構造がどのように組み込まれているかを対応表で確認します。

  • 私が使うAIサービスの攻撃対象領域を、4層マップとして描きます(ミッション1)

このような方におすすめです

  • 基礎1を修了し、実習用バックエンドをアップしてある受講生

  • プロンプトインジェクションがなぜ根本的に防げないのか、その原理から知りたい開発者・セキュリティ担当者

  • LLM・RAG・エージェントを導入することで、どこにリスクが生じるのかを1枚にまとめたい企画担当者・PM

このような方には向いていないかもしれません

  • トークン化アルゴリズムやトランスフォーマーの数式を学びたい方 - 数学は出てきません

  • コードを書く実習を期待している方 - 2-6ではapp.pyを読むだけで、作成はしません

  • この講義で実際に攻撃を試してみたい方 ― 侵入を試す実習は第4講(中級1)からで、ここではなぜ侵入されるのかを見ます

  • 基礎1のミッション0(演習バックエンドのデプロイ)を飛ばした方 ― 2~6回ではそのコードを開きます

講義の流れ - 原理 → 自分のコードに当てはめる → 攻撃対象領域マップ

全8回・55分。セクションの順番がそのまま学習順序です。

  • セクション 1 · 講義紹介(1本 · 2分 · プレビュー 1本)

  • セクション2・LLMは入力をどのように受け取るのか(5編・38分・プレビュー1編)

  • セクション 3 · 自分のバックエンドコードに当てはめて攻撃対象領域のマップを描く(2本 · 14分 · プレビュー 1本)

受講前の確認事項

  • 基礎1のミッション0を終えた状態を前提とします。

  • 今回の講義ではコンソール操作がないため、AWSの追加費用はほとんどかかりません。2-6回目ではバックエンドコードを読むだけです。

  • ブラウザ中心の講義であり、自分のPCにインストールするものはありません。

  • ナレーションはTTS音声です。

講義内容の詳細

▶ 視覚資料の位置 · basic2-01-context.png - コンテキストウィンドウ - すべてを1行につなげます

LLMは入力をどのように受け取るのか

モデルは文字を見ず、トークンという断片を見ており、システムプロンプト、過去の会話、検索された文書、ユーザー入力がコンテキストウィンドウ内ですべて一続きに連結されます。この図一つがこの講義で最も重要なのは、境界を示すものがないという事実を前提に、後の講義で扱う攻撃のほとんどが成立するからです。

次に、システムプロンプトがルールではなくお願いである理由、RAGが文書を分割・検索して注入する3段階のうち、どこが攻撃面なのか、エージェントがツールを呼び出す際に誰の権限で動くのかを順に見ていき、実際のサービスで使われる5層の統制が何を防ぎ、何を防げないのかまで確認します。

▶ ビジュアル資料の位置 · basic2-02-guardrail.png - 実際のサービスで使われる5層の制御

▶ 視覚資料位置 · basic2-04-backend.png - 構成図の4つの区画とapp.pyの3つの経路

自分のバックエンドコードに当てはめ、攻撃対象領域の地図を描く

図だけで終わりません。2-6時限では、基礎1で構築した皆さんのバックエンドの app.py を開き、converse 呼び出しの1行の中に system・messages・tools がどのように組み込まれているのかを対応表で確認します。講義で見た図が自分のアカウントのコードのどこにあるのか、そしてどの統制層が空いているのかが、このとき分かります。最後の時限では、これまで見てきたものを4層のマップに整理し、ミッション1として、皆さんが実際に使っているAIサービスの攻撃対象領域を描いてみます。このマップが、基礎3で描く信頼境界の下絵になります。

▶ ビジュアル資料の場所 · basic2-03-map.png - 4層マップ(ミッション1)

数学は出てこず、コードも書きません。コンソール操作がないため、今回の講義ではAWSの費用はほとんどかかりません。基礎1のミッション0を終えた状態を前提としていますが、スタックを削除してしまった場合でも、5分あれば再度立ち上げられます。

構成と学習方法

構成は全8回・55分で、7講の中で最も短くなっています。1回あたり6分から8分で、すべて1枚の図を見せながら説明する形式なので、概念の6回分は移動中に聴き、2-6 コード代入と2-7 ミッション1だけは画面の前でご覧ください。各回の終わりのまとめスライドには、その回の図と一文がもう一度載っているので、後で中級でつまずいたときは、そのスライドだけを見返せば十分です。

ミッション1は書式なしで、皆さんが実際に使っているAIサービスを1つ選び、4つの階層マップを描くことです。どのサービスを選べばよいか迷ったら、質問掲示板にサービス名だけ書いていただいても、方向性をお手伝いします。

次の講義

次の講義である基礎3では、やみくもに攻撃する前に実務のレッドチームが行うこと、つまり範囲を定め、資産を数え、脅威モデルを描く手順を学び、ここで描いた攻撃面マップを脅威モデル書へと発展させます。

講義の特徴

  • "90パーセント守られるものと、必ず守られるものは異なる"という一文を原理として説明します

  • 図 → 自分のアカウントのコード → 攻撃対象領域マップの順に、抽象から実物へと掘り下げます

  • ベクトルDBのように資産台帳から抜け落ちやすいものを、どこで把握すべきか実務的な観点から指摘します

  • 全7講の中で最も短く、1日で終えられます

  • 扱う分野 - 人工知能(AI)セキュリティ、LLMの動作原理、プロンプトエンジニアリングの観点から見た攻撃対象領域、RAGとAI Agent(エージェント)の構造、オフェンシブセキュリティ

受講を終えると

受講を終えると、「90パーセント守られることと、必ず守られることは違う」という一文を原理として説明できるようになり、皆さんが使っているAIサービスの一つについて、攻撃対象領域のマップが手元に残ります。このマップは基礎3で脅威モデル書へと成長します。

シリーズ「自分で突破してみるAIレッドチーミング」第7講義

  • AIレッドチーミング 1 - LLMセキュリティ入門と実習環境

  • AIレッドチーミング 2 - LLMの動作原理と攻撃対象領域 ← この講義

  • AIレッドチーミング 3 - レッドチームの業務と脅威モデリング

  • AIレッドチーミング 4 - プロンプトインジェクションを直接突破する

  • AIレッドチーミング 5 - ひとつの抜けた設定が開く攻撃

  • AIレッドチーミング 6 - エージェントとRAGを突破する

  • AIレッドチーミング 7 - 制御設計とレッドチーム報告書

前の講義のミッション成果物が後の講義の材料となる構成のため、番号順に公開され、未公開の講義は順次公開されます。

こんな方に
おすすめです

学習対象は
誰でしょう?

  • 基礎1を修了し、実習用バックエンドをアップしてある受講生

  • プロンプトインジェクションがなぜ根本的に防げないのか、その原理から知りたい開発者・セキュリティ担当者

  • LLM・RAG・エージェントを導入することで、どこにリスクが生じるのかを1枚にまとめたい企画担当者・PM

前提知識、
必要でしょうか?

  • 基礎1のミッション0(実習バックエンドのデプロイと最初のクエリのキャプチャ)を完了した状態を前提とします。スタックを削除していた場合は、CloudShellでdeploy.shを1行実行するだけで、5分もあれば再び立ち上がります。数学・コード作成はありません。

こんにちは
rmsxodxod1289です。

キャリア認証

模擬ハッキングから出発し、情報セキュリティ管理体制を構築する実務者です。

完成車メーカーとエネルギー企業の年間セキュリティ診断を担当し、インフラ・Web・アプリケーションを

層ごとに診断し、同じ顧客企業のISMS-P認証を初回・事後・更新の3回にわたって

対応し、技術的保護対策の領域を単独で担当しました。

現在は、一人で担う情報保護担当者として初回認証取得の準備を進めながら、AIセキュリティガバナンス

体制を設計しています。基準がまだ形成途上にある領域であるため、統制対象の定義から

自ら構築しなければならない立場です。

情報セキュリティ技師・CPPG・ISO/IEC 27001審査員補の資格を保有しており、東国大学の国際情報保護񟿿

大学院の人工知能セキュリティ学科で、AI環境における情報漏えい経路と認証基準の照合を研究しています。

経験5年9か月。顧客企業名と実際に発見した脆弱性は秘密保持の対象であるため、講義では

取り扱いません。

受講レビュー

まだ十分な評価が集まっていない講座です。
ぜひ最初のレビューをお寄せください。

似ている講座

同じ分野の他の講座を見てみましょう!