23. 如何设计一个可信的 Agent Benchmark
研究与工程 · 4~6 小时
学习目标
- 掌握 Task Validity、Outcome Validity 与 Reporting
- 避免不可完成任务和错误 Reward
- 建立 Benchmark Card 与质量检查表
前置知识
- 第 7、22 章
本章产物: 为自己的 EvalSuite 完成一份 Benchmark Card 和 ABC 风格检查。
23.1 Benchmark 不只是 Dataset
完整 Benchmark:
Task Spec
Environment
Agent Interface
Tool Interface
Evaluator
Metrics
Reference / Policy
Reporting Protocol任何一层错误都会改变排名。
23.2 Task Validity
检查:
- 任务是否可完成;
- 指令是否足够;
- 时间/资源限制是否合理;
- 人类能否完成;
- 是否依赖不可控外部服务。
23.3 Outcome Validity
最关键:
Reward / Scorer 是否真的代表任务成功?
典型错误:
- 检查按钮被点击,而不是状态保存;
- 检查文件存在,而不检查内容;
- 空回答被 parser 当成功;
- 测试覆盖不足。
23.4 Environment Validity
环境必须:
- deterministic enough;
- resettable;
- versioned;
- isolated;
- observable。
WebArena、StableToolBench 等工作都强调环境稳定性的重要性。
23.5 Reporting
Benchmark 结果至少报告:
agent/system version
model
prompt/tool settings
number of runs
sampling
limits
environment
score
uncertainty
failures
cost否则排行榜数字难以复现。
23.6 Human Baseline
尤其复杂任务应让人类在同一环境完成,用于确认:
- Task 可理解;
- Evaluator 可靠;
- 预算合理。
23.7 Benchmark Card
建议模板:
Purpose
Target Agent Type
Task Sources
Environment
Success Signal
Metrics
Known Failure Modes
Contamination Risk
License
Version
Human Validation
Limitations23.8 验收问题
- Task Validity 与 Outcome Validity 有什么区别?
- Benchmark 环境为什么必须版本化?
- 一个“公开排行榜”还应该报告哪些运行细节?