1. Agent Evaluation 全景图
基础方法论 · 1~2 小时
学习目标
- 建立 Agent Evaluation 的完整知识地图
- 区分能力评测、产品评测与生产评测
- 理解评测对象与评测过程两个正交维度
前置知识
- 第 0 章
本章产物: 画出自己的 Agent Evaluation Landscape,并标注当前产品已有/缺失能力。
1.1 为什么 Agent Evaluation 比模型评测复杂
传统模型评测通常固定输入、调用模型、得到输出,然后比较答案。Agent 会在执行过程中改变自己的上下文和外部环境,因此它是一个交互系统。
同一个任务可能因为:
- 第一次 Tool Call 返回的数据不同;
- Agent 选择不同工具;
- 用户模拟器给出不同回答;
- Web 页面变化;
- 数据库初始状态不同;
- 模型采样随机性;
- Agent 自己的重试和规划差异;
而产生不同轨迹。
因此 Agent Evaluation 的关键对象不再只是 (input, output),而是:
(initial state, task, policy)
↓
interaction trajectory
↓
(final state, answer, artifacts)1.2 两个正交维度:What 与 How
一个实用的分类方式是把评测问题拆成两个维度。
What to evaluate
- Task Outcome
- Planning / Reasoning Behavior
- Tool Use
- Memory
- Recovery
- Reliability
- Safety
- Cost / Latency
- User Experience
- Policy Compliance
How to evaluate
- 静态 Dataset
- 动态 Environment
- User Simulator
- Deterministic Rule
- State Checker
- Unit / Integration Test
- LLM Judge
- Human Evaluation
- Multi-run Statistics
- Online Sampling
不要把“评什么”和“怎么评”混在一起。例如“Tool Use”是对象,“AST 校验”或“执行 API 后检查数据库”才是方法。
1.3 三个层级
Capability Eval
回答:“这个 Agent 具备什么能力?”
典型工具:公开 Benchmark。
Product Eval
回答:“我的 Agent 产品在定义好的真实场景下是否足够好?”
典型方法:私有 EvalSuite、状态验证、历史失败集。
Production Eval
回答:“上线以后是否发生 Drift、Regression、异常和安全问题?”
典型方法:Trace Sampling、Shadow Eval、线上指标和 Incident Replay。
1.4 Agent Evaluation Pyramid
L7 Production / Online
L6 Safety / Compliance
L5 Reliability / Repeated Runs
L4 Environment State
L3 Trajectory / Tool / Recovery
L2 Task Outcome / Progress
L1 Component / Model / Skill金字塔不是“越高越高级”,而是不同粒度的证据。一个生产 Release Gate 常常同时要求 L2、L4、L5、L6 和系统指标。
1.5 评测结果不要坍缩成一个分数
推荐 Scorecard:
| 维度 | 指标 |
|---|---|
| Outcome | Task Success Rate |
| State | Final State Accuracy |
| Tool | Selection / Argument / Execution |
| Trajectory | Violation / Loop / Redundancy |
| Reliability | pass^k / variance |
| Safety | Unsafe Action Rate |
| Efficiency | P50/P95 latency, cost/success |
Overall Score 可以用于展示,但不能让 Safety 被其他指标平均“抵消”。
1.6 本章实验
选一个你熟悉的 Agent,把每个已有指标放到 What/How 矩阵中。如果某个指标无法说明它评的对象和证据来源,就先标记为“不可解释指标”。
1.7 验收问题
- Capability Eval 与 Production Eval 的目标有什么不同?
- “LLM Judge”属于 What 还是 How?
- 为什么 Overall Score 不能成为唯一 Release Gate?
本章依据
原理性结论优先来自原始论文和官方文档。论文中的实验数字只属于论文声明的模型、数据、环境和评测设置,不能直接外推为你的生产结论。