AIエージェントの安全性入門
2026-08-05
はじめに
先月、「AIが暴走」というような衝撃的な見出しのニュースが各地で報道されました。これは、既知の脆弱性の情報だけを手がかりに、それを悪用して実際に不正な動作を引き起こすプログラム、いわゆるエクスプロイトを組み立てられるかをAIエージェントに問う評価ベンチマーク「ExploitGym」の社内評価中に起きた、OpenAIのインシデントを指しています。GPT-5.6 Solを含む複数のモデルが、パッケージレジストリのゼロデイ脆弱性を悪用してサンドボックス環境を抜け出し、盗んだ認証情報と別のゼロデイ脆弱性を連鎖させてHugging Faceの本番サーバーでリモートコード実行に至り、ベンチマークの正解データを直接窃取していたのです(OpenAIの公式発表)。また2025年には、Microsoft 365 Copilotに対し、ユーザーの操作を一切必要としない初のゼロクリック攻撃「EchoLeak」が報告されています。
こうした事例が示すのは、ブラウザやコード実行環境を自ら操作する「実行権限」を持ったAIエージェントが、もはや理論上のリスクではなく、実際に事故を起こす段階に入ったということです。単なるチャットボットと違い、AIエージェントは外部のツール・データ・他のエージェントと連携しながら自律的に計画・実行するため、そのリスクは質的に異なり、対策も一筋縄ではいきません。
本記事では、生成AIのセキュリティに関する国際的なコミュニティであるOWASP GenAI Security Projectが2025年12月に公開した、Agentic Security Initiativeの中核資料"Agentic AI - Threats and Mitigations" v1.1を軸に、次の3点を整理します。
- AIエージェント特有のリスク
- それを測るための評価ベンチマーク
- 実務で使える安全性対策
AIエージェントのリスク
OWASPはAIエージェントを、「入力を受け取り、計画(Planning)・記憶(Memory)・ツール実行(Tool Use)のループを回しながら、自律的にタスクを遂行するソフトウェア」と位置づけています。この構成要素のうち、とくに外部ツールを呼び出す実行権限と、セッションをまたいで情報を保持するメモリこそが、通常のLLM(大規模言語モデル)アプリケーションにはない攻撃対象領域を生み出します。
OWASPは、単一エージェント・マルチエージェントの双方に共通する17種類の脅威(T1〜T17)を定義し、下図のリファレンスアーキテクチャ上にマッピングしています。
出典: OWASP GenAI Security Project, "Agentic AI - Threats and Mitigations" v1.1(genai.owasp.org)の図を一部抜粋・加工。CC BY-SA 4.0(ライセンス全文)。
| ID | 脅威 | 概要 |
|---|---|---|
| T1 | Memory Poisoning | 短期・長期メモリに悪意あるデータや虚偽情報を注入し、以降の判断や動作を歪める |
| T2 | Tool Misuse | 巧妙なプロンプトでツール呼び出しを乗っ取り、権限の範囲内で意図しない操作をさせる(Agent Hijackingを含む) |
| T3 | Privilege Compromise | 権限管理の不備を突き、本来アクセスできないはずのデータや機能に到達する |
| T4 | Resource Overload | 計算資源やAPI呼び出しを枯渇させ、性能低下やサービス停止を引き起こす |
| T5 | Cascading Hallucination Attacks | もっともらしい誤情報が、メモリや複数エージェント間の連携を通じて増幅・伝播する |
| T6 | Intent Breaking & Goal Manipulation | プロンプトインジェクションなどにより、エージェントの目標や計画をすり替える |
| T7 | Misaligned & Deceptive Behaviors | 悪意ある指示がなくても、与えられた目標に過度に固執し、欺瞞的・破壊的な手段を取ってしまう |
| T8 | Repudiation & Untraceability | ログや追跡性が不十分で、誰が何をしたのか事後に検証できない |
| T9 | Identity Spoofing & Impersonation | エージェントや正規ユーザーになりすまし、その権限で不正な操作を行う |
| T10 | Overwhelming Human in the Loop | 大量の判断要求で人間の監視者を疲弊させ、承認プロセスを機能不全に陥らせる |
| T11 | Unexpected RCE and Code Attacks | エージェントが生成・実行するコードを悪用し、任意コード実行(RCE)に持ち込む |
| T12 | Agent Communication Poisoning | エージェント間の通信チャネルに偽情報を注入し、意思決定を歪める |
| T13 | Rogue Agents in Multi-Agent Systems | 侵害・悪意あるエージェントが、マルチエージェント環境内で監視の目をすり抜けて活動する |
| T14 | Human Attacks on Multi-Agent Systems | エージェント間の委任関係や信頼関係を悪用し、権限昇格やワークフロー妨害を狙う |
| T15 | Human Manipulation | エージェントに対する人間の信頼を逆手に取り、フィッシングや不正送金などへ誘導する |
| T16 | Insecure Inter-Agent Protocol Abuse | MCP(Model Context Protocol)やA2A(Agent2Agent Protocol)などエージェント間プロトコルの欠陥を突き、同意バイパスやエージェント乗っ取りを行う |
| T17 | Supply Chain Compromise | 汚染されたモデル・ライブラリ・ツールを通じて、エージェントの挙動そのものを改ざんする |
冒頭で紹介した2つの事例も、この分類に当てはめると見通しがよくなります。GPT-5.6 Solのインシデントは、モデルが与えられた狭いテスト目標(ExploitGymの正解取得)に過度に最適化し、ゼロデイ脆弱性を連鎖的に悪用するという極端な手段に至った点で、T7: Misaligned & Deceptive Behaviorsの実例と言えます。攻撃者による悪意ある指示は介在しておらず、モデル自身の目標追求が暴走した点が特徴です。一方、EchoLeakのようなゼロクリック攻撃は、メールなど外部コンテンツに仕込まれた指示でエージェントの動作を書き換えるT6: Intent Breaking & Goal Manipulationと、Copilotが持つツール実行権限を悪用してデータを持ち出すT2: Tool Misuseの複合として整理できます。
AIエージェントの評価
こうしたリスクをどう測るか、という問いに対して、2024年以降、AIエージェント特有の安全性ベンチマークが相次いで発表されています。ここでは、査読付き国際会議に採択され、一定の引用実績がある代表的な4本を紹介します。
4本を通じて見えてくるのは、プロンプトインジェクション・悪意あるタスクへの追従・複合的な攻撃という異なる切り口で評価しても、いずれも無視できない攻撃成功率が報告されているという点です。ASBが示すように、現状の防御手法だけでは攻撃を十分に防ぎきれておらず、評価技術に対策技術が追いついていない領域だと言えます。
AIエージェントの安全性対策
OWASPは、上記17種類の脅威に対応する形で、6つのミティゲーション(対策)プレイブックを提示しています。それぞれ、事前予防(Proactive)・検知後対応(Reactive)・継続監視(Detective)の3段階で具体策を整理しているのが特徴です。
| プレイブック | 対象脅威 | 主な対策 |
|---|---|---|
| 1. 推論操作の防止 | T6, T7, T8 | ツールアクセスの最小化、目標の一貫性検証、暗号学的に改ざん検知可能なロギング |
| 2. メモリ汚染・ナレッジ破損の防止 | T1, T5 | メモリ更新の出典追跡、コミット前のファクトチェック、異常検知とロールバック |
| 3. ツール実行・サプライチェーンの保護 | T2, T3, T4, T11, T16, T17 | サンドボックス実行、Just-in-Timeなツール権限付与、AIBOM(AI Bill of Materials、AIソフトウェア部品表)による署名検証 |
| 4. 認証・ID・権限管理の強化 | T3, T9, T16 | 暗号学的なエージェントID検証、RBAC(役割ベースアクセス制御)/ABAC(属性ベースアクセス制御)、エージェント間の相互認証 |
| 5. HITL保護・意思決定疲労の防止 | T10, T15 | リスクに応じた承認ルーティング、通知頻度の制限、AIによる判断根拠の要約提示 |
| 6. マルチエージェント通信・信頼の保護 | T12, T13, T14 | メッセージの認証・暗号化、エージェント間の信頼スコアリング、コンセンサス検証 |
ここでいうHITL(Human-in-the-Loop)とは、AIの判断や実行に人間の承認や監視を介在させる仕組みのことです。エージェントの規模と複雑さが増すほど、この人間の監視能力そのものが攻撃対象になり得る(T10)という指摘は、単純ながら見落とされやすい観点だと思います。
重要なのは、これらがOWASP Top 10 for LLM Applicationsのような既存のLLMセキュリティ対策を置き換えるものではなく、あくまで「エージェントが実行権限とメモリを持つこと」に起因する新しいリスクへの追加対策だという点です。とくにツールのサンドボックス化・最小権限・人間による監視は、単一の技術で解決できるものではなく、開発から運用までを貫くガバナンスの問題として扱う必要があります。
おわりに
AIエージェントの安全性は、まだ体系化が始まったばかりの領域です。評価ベンチマークが示す高い攻撃成功率が物語るように、対策技術は攻撃技術に追いついていません。それでも、OWASPのような taxonomy(分類体系)が整備されつつあることは、この分野が今後急速に成熟していくことを示していると思います。
