セキュリティ脅威モデルプロンプトインジェクション監査
AI Agent設計ドキュメント
セキュリティ脅威モデル:企業向けAI Agentワークフロー
文書を読み、ツールを呼び出し、成果物を作成し、企業業務を支援するAgentワークフローの脅威モデルです。
- ステータス
- 公開可能なポートフォリオサンプル
- 最終更新
- 2026-05-18
範囲
この脅威モデルは、文書を読み、業務文脈を推論し、ツールを呼び出し、成果物を作成し、企業オペレーションを支援するAI Agentワークフローを対象にします。
保護対象
- ソース文書とポリシーリポジトリ。
- 記録システムのデータ。
- 認証情報とトークン。
- ユーザープロンプトとアップロードファイル。
- Agent出力と中間成果物。
- 監査ログと承認記録。
信頼境界
- 外部入力境界:PDF、スプレッドシート、ウェブページ、メール、チャット文、アップロードファイル。
- モデル境界:プロンプト、検索コンテキスト、ツール応答、生成出力。
- ツール境界:コネクタ、API、ブラウザ自動化、ファイル操作。
- 人間承認境界:最終判断、顧客連絡、投稿、オンボーディング、財務操作。
プロンプトインジェクション
不信頼文書やユーザーテキストが、ポリシー無視、データ漏えい、未承認ツール呼び出しをAgentに誘導する可能性があります。
- 検索内容は指示ではなくデータとして扱います。
- 文書読み取りと書き込み可能ワーカーを分離します。
- 型付き出力と検証を使います。
- ツール許可リストと最小権限を適用します。
過剰自動化
人間レビュー前に責任ある操作が実行される可能性があります。
- 自動化しない操作を定義します。
- 高影響のステップには人間承認を必須にします。
- ドラフト生成と最終実行を分離します。
- レビュアーIDと承認状態を記録します。
データ漏えい
機密情報が誤ったモデル、ユーザー、コネクタ、下流成果物へ渡る可能性があります。
- 検索前にアクセス制御を行います。
- 秘密情報をプロンプトやモデル可視状態に入れません。
- ワーカーの役割ごとにツール権限を制限します。
- 必要に応じて機密データをマスクまたはトークン化します。
根拠の幻覚と品質劣化
- 知識ワークフローではソース参照を必須にします。
- 引用を検索ソースIDと照合します。
- ソース不足や矛盾がある場合は人間へエスカレーションします。
- ゴールデンケースを維持し、プロンプト、ツール、インデックスをバージョン管理します。
- 人間による修正率とエスカレーション傾向を監視します。
最小監査イベント
- ワークフローID、ユーザーID、AgentワーカーID、ソースID、プロンプトバージョン、ツール呼び出し、モデルバージョン、出力成果物ID、レビュアーID、判断状態、タイムスタンプ。