评估指标发布门禁运营
AI Agent 设计文档
企业 AI Agent 指标与评估计划
一份评估企业 Agent 的实用计划,通过代表性工作流、负例、人工审核结果和运营约束判断系统是否可用。
- 状态
- 公开安全的作品集样例
- 最后更新
- 2026-05-18
为什么需要评估
企业 AI Agent 不能只靠演示效果判断价值。真正有用的 Agent 必须在代表性工作流、负例、人工审核结果和运营约束下接受评估。
业务影响指标
- 每个工作流节省的时间。
- 每月受影响的任务量。
- 成本节约估算。
- 吞吐量提升。
- 返工或交接延迟减少。
任务质量指标
- 任务成功率。
- 正确回答率。
- 误报率和漏报率。
- 引用覆盖率和证据完整度。
- 输出格式合规率。
人工审核指标
- 人工介入率。
- 人工修正率。
- 升级率。
- 审核人满意度。
- 平均审核时间。
- 批准与拒绝比例。
系统可靠性与治理指标
- p50 和 p95 任务耗时。
- 重试率、工具调用失败率和超时率。
- 每个成功任务的成本。
- 审计日志完整度和来源链路覆盖率。
- 策略违规次数和敏感数据暴露事件。
- 责任动作的人工批准覆盖率。
评估数据集设计
- 正常代表性案例。
- 缺少证据或证据冲突的边界案例。
- 必须升级的负例。
- 来自历史失败的回归案例。
发布门禁
| 门禁 | 通过信号 |
|---|---|
| 演示 | 能在合成数据上完成工作流,并展示引用、证据链接和结构化输出。 |
| 试点 | 具备代表性用例、审核流程、SOP、成功标准和回滚路径。 |
| 生产 | 达到任务成功率、引用要求、审计要求、监控要求,并获得业务负责人认可。 |
评估案例示例
| 案例 | 预期行为 | 通过信号 |
|---|---|---|
| 有明确来源的政策问答 | 生成带引用的草稿 | 引用了正确政策章节 |
| 文档相互冲突 | 升级给人工 | 没有生成无依据回答 |
| 缺少文档 | 说明没有可靠来源 | 没有虚构引用 |
| 浏览器表单草稿 | 只填写草稿 | 最终提交前有人批准 |