セキュリティ脅威モデルプロンプトインジェクション監査

AI Agent設計ドキュメント

セキュリティ脅威モデル:企業向けAI Agentワークフロー

文書を読み、ツールを呼び出し、成果物を作成し、企業業務を支援するAgentワークフローの脅威モデルです。

ステータス
公開可能なポートフォリオサンプル
最終更新
2026-05-18

範囲

この脅威モデルは、文書を読み、業務文脈を推論し、ツールを呼び出し、成果物を作成し、企業オペレーションを支援するAI Agentワークフローを対象にします。

保護対象

  • ソース文書とポリシーリポジトリ。
  • 記録システムのデータ。
  • 認証情報とトークン。
  • ユーザープロンプトとアップロードファイル。
  • Agent出力と中間成果物。
  • 監査ログと承認記録。

信頼境界

  1. 外部入力境界:PDF、スプレッドシート、ウェブページ、メール、チャット文、アップロードファイル。
  2. モデル境界:プロンプト、検索コンテキスト、ツール応答、生成出力。
  3. ツール境界:コネクタ、API、ブラウザ自動化、ファイル操作。
  4. 人間承認境界:最終判断、顧客連絡、投稿、オンボーディング、財務操作。

プロンプトインジェクション

不信頼文書やユーザーテキストが、ポリシー無視、データ漏えい、未承認ツール呼び出しをAgentに誘導する可能性があります。

  • 検索内容は指示ではなくデータとして扱います。
  • 文書読み取りと書き込み可能ワーカーを分離します。
  • 型付き出力と検証を使います。
  • ツール許可リストと最小権限を適用します。

過剰自動化

人間レビュー前に責任ある操作が実行される可能性があります。

  • 自動化しない操作を定義します。
  • 高影響のステップには人間承認を必須にします。
  • ドラフト生成と最終実行を分離します。
  • レビュアーIDと承認状態を記録します。

データ漏えい

機密情報が誤ったモデル、ユーザー、コネクタ、下流成果物へ渡る可能性があります。

  • 検索前にアクセス制御を行います。
  • 秘密情報をプロンプトやモデル可視状態に入れません。
  • ワーカーの役割ごとにツール権限を制限します。
  • 必要に応じて機密データをマスクまたはトークン化します。

根拠の幻覚と品質劣化

  • 知識ワークフローではソース参照を必須にします。
  • 引用を検索ソースIDと照合します。
  • ソース不足や矛盾がある場合は人間へエスカレーションします。
  • ゴールデンケースを維持し、プロンプト、ツール、インデックスをバージョン管理します。
  • 人間による修正率とエスカレーション傾向を監視します。

最小監査イベント

  • ワークフローID、ユーザーID、AgentワーカーID、ソースID、プロンプトバージョン、ツール呼び出し、モデルバージョン、出力成果物ID、レビュアーID、判断状態、タイムスタンプ。