評価指標リリースゲート運用
AI Agent設計ドキュメント
企業向けAI Agentの指標と評価計画
代表的ワークフロー、ネガティブケース、人間レビュー結果、運用制約を通じて企業Agentを評価するための実務計画です。
- ステータス
- 公開可能なポートフォリオサンプル
- 最終更新
- 2026-05-18
評価が必要な理由
企業向けAI Agentは、デモの見栄えだけでは判断できません。有用なAgentは、代表的ワークフロー、ネガティブケース、人間レビュー結果、運用制約に照らして評価する必要があります。
ビジネス影響指標
- ワークフローごとの削減時間。
- 影響を受ける月間タスク量。
- コスト削減見込み。
- 処理量の改善。
- 手戻りや引き継ぎ遅延の削減。
タスク品質指標
- タスク成功率。
- 正答率。
- 偽陽性率と偽陰性率。
- 引用カバレッジと証拠の完全性。
- 出力形式の遵守率。
人間レビュー指標
- 人間介入率。
- 人間による修正率。
- エスカレーション率。
- レビュアー満足度。
- 平均レビュー時間。
- 承認と却下の比率。
システム信頼性とガバナンス指標
- p50 / p95 のタスク時間。
- リトライ率、ツール呼び出し失敗率、タイムアウト率。
- 成功タスクあたりのコスト。
- 監査ログ完全性とソース系譜カバレッジ。
- ポリシー違反件数と機密データ露出インシデント。
- 責任操作に対する人間承認カバレッジ。
評価データセット設計
- 通常の代表ケース。
- 証拠不足または証拠矛盾を含む境界ケース。
- 必ずエスカレーションすべきネガティブケース。
- 過去の失敗から作る回帰ケース。
リリースゲート
| ゲート | 合格シグナル |
|---|---|
| デモ | 合成データでワークフローを完了し、引用、証拠リンク、構造化出力を示せる。 |
| パイロット | 代表ユースケース、レビューフロー、SOP、成功基準、ロールバック手段がある。 |
| 本番 | タスク成功率、引用、監査、監視、業務オーナー承認の条件を満たす。 |
評価ケース例
| ケース | 期待動作 | 合格シグナル |
|---|---|---|
| 明確なソースがあるポリシー回答 | 引用付きドラフトを作る | 正しいポリシー章を引用する |
| 文書が矛盾している | 人間へエスカレーションする | 根拠のない回答をしない |
| 文書が存在しない | 信頼できるソースがないと明示する | 架空の引用を作らない |
| ブラウザフォームのドラフト | ドラフトのみ入力する | 最終送信前に人間承認がある |