安全威胁模型提示注入审计

AI Agent 设计文档

安全威胁模型:企业 AI Agent 工作流

一份面向企业 Agent 工作流的威胁模型,覆盖文档读取、工具调用、产物起草和企业运营辅助场景。

状态
公开安全的作品集样例
最后更新
2026-05-18

范围

本威胁模型覆盖会读取文档、理解业务上下文、调用工具、起草产物或辅助企业运营用户的 AI Agent 工作流。

资产

  • 源文档和政策库。
  • 记录系统数据。
  • 凭证和令牌。
  • 用户提示和上传文件。
  • Agent 输出和中间产物。
  • 审计日志和批准记录。

信任边界

  1. 外部输入边界:PDF、表格、网页、邮件、聊天文本和用户上传内容。
  2. 模型边界:提示、检索上下文、工具返回和生成内容。
  3. 工具边界:连接器、API、浏览器自动化和文件操作。
  4. 人工批准边界:最终决策、客户沟通、发布、入职或财务动作。

提示注入

不可信文档或用户文本可能诱导 Agent 忽略策略、泄露数据或调用未授权工具。

  • 把检索内容视为数据,而不是指令。
  • 把文档读取与可写工作单元隔离。
  • 使用结构化输出和校验。
  • 使用工具白名单和最小权限。

过度自动化

系统可能在人工审核前执行责任动作。

  • 定义不可自动化动作。
  • 高影响步骤必须人工批准。
  • 区分草稿生成和最终执行。
  • 记录审核人身份和批准状态。

数据泄露

敏感内容可能暴露给错误模型、用户、连接器或下游产物。

  • 检索前执行访问控制。
  • 不要把密钥放入提示或模型可见状态。
  • 按工作单元限制工具权限。
  • 必要时对敏感数据做脱敏或标记化。

证据幻觉与质量漂移

  • 知识类工作流必须要求来源引用。
  • 引用需要与检索来源 ID 校验。
  • 来源缺失或冲突时升级给人工。
  • 维护黄金测试集,并版本化提示、工具和索引。
  • 监控人工修正率和升级趋势。

最小审计字段

  • 工作流 ID、用户 ID、Agent 工作单元 ID、来源 ID、提示版本、工具调用、模型版本、输出产物 ID、审核人 ID、决策状态和时间戳。