Agent 评测手册
FROM AGENT RUNS TO PRODUCTION QUALITY
让 Agent 的“感觉不错”,变成可验证的工程证据。
这是一份面向 Agent 工程实践的系统学习手册。内容覆盖 Agent Evaluation 方法论、EvalCase 与 Dataset、结果与状态评测、Tool/Trajectory、LLM-as-a-Judge、多次运行可靠性、安全评测、在线评测、Benchmark 设计、开源评测项目选型,以及 Inspect AI 的完整工程实践。
Agent 的质量不能只通过“看几个回答”判断。一个真正能够执行任务的 Agent 会规划、调用工具、读取外部内容、修改系统状态、重试、恢复并与用户持续交互,因此评测必须同时观察 任务结果、环境状态、执行轨迹、可靠性、效率与安全边界。
开始学习 · 方法论 · 开源项目地图 · 完整实战 · 实践主线
44 个系统章节
入门
- 如何使用这份手册
- Agent Evaluation 全景图
- 为什么 LLM Eval 不等于 Agent Eval
- Agent Evaluation Lifecycle
方法论
- 证据模型:到底什么能证明 Agent 做对了
- 评测对象、系统边界与可观察性
- Task Outcome 与 Success Criteria
- EvalCase 与 Dataset 设计
- 数据切分、泄漏、污染与版本化
Evaluator 技术
- Deterministic Evaluation
- State-based Evaluation
- Tool Use Evaluation
- Trajectory 与 Planning Evaluation
- LLM-as-a-Judge
- Rubric Engineering
- Human Evaluation
可靠性、安全与生产
- Reliability:多次运行与 pass^k
- Efficiency:延迟、Token、工具与 Cost per Success
- Agent Safety 与 Prompt Injection
- Multi-Agent Evaluation
- Online Evaluation 与 Production Monitoring
- Regression Testing 与 Release Gate
- Evaluating the Evaluator
- 如何设计一个可信的 Agent Benchmark
Benchmark 专题
- AgentBench、AgentBoard 与 GAIA
- τ-bench、τ²-bench 与状态评测
- WebArena 与 BrowserGym
- SWE-bench:执行结果驱动的 Coding Agent 评测
- ToolBench、StableToolBench 与 Function Calling
- AgentDojo、Agent-SafetyBench 与 OpenAgentSafety
Inspect AI
- Inspect AI:定位、架构与适用边界
- Task、Dataset、Sample、Solver 与 Scorer
- Agent、Tool、Sandbox 与外部 Agent
- EvalLog、Trace、Hook、EvalSet 与 Extension
- Inspect AI + GoClaw:Evaluation Runtime 设计
实战与参考
- 完整实战:从一个 Agent 到 Release Gate
- 企业案例:Customer Service / Kubernetes Agent
- 论文阅读地图与 Benchmark Card
- 模板、Failure Taxonomy 与术语速查
- 实践主线:从零启动一个可评测的客服 Agent
- 实践主线:实现可诊断的 Scorer
- 实践主线:重复运行、故障注入与回归门禁
- 实践主线:把 Reference Adapter 换成真实 Agent
- 综合作业:为自己的 Agent 建立第一条 Release Pipeline
学习主线
理解 Agent 为什么难评
↓
定义成功条件与证据
↓
构造 EvalCase / Dataset
↓
选择 Evaluator
↓
运行 Agent + 采集 Trace
↓
Outcome / State / Trajectory / Safety
↓
多次运行与不确定性
↓
Regression / Release Gate
↓
Production Online EvalHands-on Labs
本站建议所有实验在本地或隔离的测试环境中运行。不要为了学习 Eval 而把测试 Agent 直接连接生产数据库、生产 Kubernetes 或真实客户系统。
每一个 Lab 至少保存:
- EvalCase 版本
- Agent / Model / Prompt / Tool 版本
- Environment Snapshot
- 原始 Trace
- Scorer 输出
- 聚合指标
- 失败分类
- 成本与延迟
- 结论与适用边界
主线 Lab 可以直接运行:
make agent-eval-lab-smoke
make agent-eval-lab-report LAB_RUNS=5
make agent-eval-lab-gate LAB_RUNS=5