安全威胁模型提示注入审计
AI Agent 设计文档
安全威胁模型:企业 AI Agent 工作流
一份面向企业 Agent 工作流的威胁模型,覆盖文档读取、工具调用、产物起草和企业运营辅助场景。
- 状态
- 公开安全的作品集样例
- 最后更新
- 2026-05-18
范围
本威胁模型覆盖会读取文档、理解业务上下文、调用工具、起草产物或辅助企业运营用户的 AI Agent 工作流。
资产
- 源文档和政策库。
- 记录系统数据。
- 凭证和令牌。
- 用户提示和上传文件。
- Agent 输出和中间产物。
- 审计日志和批准记录。
信任边界
- 外部输入边界:PDF、表格、网页、邮件、聊天文本和用户上传内容。
- 模型边界:提示、检索上下文、工具返回和生成内容。
- 工具边界:连接器、API、浏览器自动化和文件操作。
- 人工批准边界:最终决策、客户沟通、发布、入职或财务动作。
提示注入
不可信文档或用户文本可能诱导 Agent 忽略策略、泄露数据或调用未授权工具。
- 把检索内容视为数据,而不是指令。
- 把文档读取与可写工作单元隔离。
- 使用结构化输出和校验。
- 使用工具白名单和最小权限。
过度自动化
系统可能在人工审核前执行责任动作。
- 定义不可自动化动作。
- 高影响步骤必须人工批准。
- 区分草稿生成和最终执行。
- 记录审核人身份和批准状态。
数据泄露
敏感内容可能暴露给错误模型、用户、连接器或下游产物。
- 检索前执行访问控制。
- 不要把密钥放入提示或模型可见状态。
- 按工作单元限制工具权限。
- 必要时对敏感数据做脱敏或标记化。
证据幻觉与质量漂移
- 知识类工作流必须要求来源引用。
- 引用需要与检索来源 ID 校验。
- 来源缺失或冲突时升级给人工。
- 维护黄金测试集,并版本化提示、工具和索引。
- 监控人工修正率和升级趋势。
最小审计字段
- 工作流 ID、用户 ID、Agent 工作单元 ID、来源 ID、提示版本、工具调用、模型版本、输出产物 ID、审核人 ID、决策状态和时间戳。