GOCLAWAGENT EVALUATION
GoClaw 首页

FROM AGENT RUNS TO PRODUCTION QUALITY

让 Agent 的“感觉不错”,
变成可验证的工程证据。

这是一份面向工程实践的 Agent Evaluation 手册,覆盖 Outcome、State、Tool、Trajectory、Reliability、Safety、Benchmark 与 Inspect AI。

44系统章节
5可运行 Notebook
4评测模板

LEARNING PATH

从成功标准到 Release Gate

先定义证据,再选择 Evaluator,最后把评测接入回归、上线和生产监控。

Agent 评测手册

FROM AGENT RUNS TO PRODUCTION QUALITY

让 Agent 的“感觉不错”,变成可验证的工程证据。

这是一份面向 Agent 工程实践的系统学习手册。内容覆盖 Agent Evaluation 方法论、EvalCase 与 Dataset、结果与状态评测、Tool/Trajectory、LLM-as-a-Judge、多次运行可靠性、安全评测、在线评测、Benchmark 设计、开源评测项目选型,以及 Inspect AI 的完整工程实践。

Agent 的质量不能只通过“看几个回答”判断。一个真正能够执行任务的 Agent 会规划、调用工具、读取外部内容、修改系统状态、重试、恢复并与用户持续交互,因此评测必须同时观察 任务结果、环境状态、执行轨迹、可靠性、效率与安全边界

开始学习 · 方法论 · 开源项目地图 · 完整实战 · 实践主线

44 个系统章节

入门

  1. 如何使用这份手册
  2. Agent Evaluation 全景图
  3. 为什么 LLM Eval 不等于 Agent Eval
  4. Agent Evaluation Lifecycle

方法论

  1. 证据模型:到底什么能证明 Agent 做对了
  2. 评测对象、系统边界与可观察性
  3. Task Outcome 与 Success Criteria
  4. EvalCase 与 Dataset 设计
  5. 数据切分、泄漏、污染与版本化

Evaluator 技术

  1. Deterministic Evaluation
  2. State-based Evaluation
  3. Tool Use Evaluation
  4. Trajectory 与 Planning Evaluation
  5. LLM-as-a-Judge
  6. Rubric Engineering
  7. Human Evaluation

可靠性、安全与生产

  1. Reliability:多次运行与 pass^k
  2. Efficiency:延迟、Token、工具与 Cost per Success
  3. Agent Safety 与 Prompt Injection
  4. Multi-Agent Evaluation
  5. Online Evaluation 与 Production Monitoring
  6. Regression Testing 与 Release Gate
  7. Evaluating the Evaluator
  8. 如何设计一个可信的 Agent Benchmark

Benchmark 专题

  1. AgentBench、AgentBoard 与 GAIA
  2. τ-bench、τ²-bench 与状态评测
  3. WebArena 与 BrowserGym
  4. SWE-bench:执行结果驱动的 Coding Agent 评测
  5. ToolBench、StableToolBench 与 Function Calling
  6. AgentDojo、Agent-SafetyBench 与 OpenAgentSafety

Inspect AI

  1. Inspect AI:定位、架构与适用边界
  2. Task、Dataset、Sample、Solver 与 Scorer
  3. Agent、Tool、Sandbox 与外部 Agent
  4. EvalLog、Trace、Hook、EvalSet 与 Extension
  5. Inspect AI + GoClaw:Evaluation Runtime 设计

实战与参考

  1. 完整实战:从一个 Agent 到 Release Gate
  2. 企业案例:Customer Service / Kubernetes Agent
  3. 论文阅读地图与 Benchmark Card
  4. 模板、Failure Taxonomy 与术语速查
  5. 实践主线:从零启动一个可评测的客服 Agent
  6. 实践主线:实现可诊断的 Scorer
  7. 实践主线:重复运行、故障注入与回归门禁
  8. 实践主线:把 Reference Adapter 换成真实 Agent
  9. 综合作业:为自己的 Agent 建立第一条 Release Pipeline

学习主线

理解 Agent 为什么难评
        ↓
定义成功条件与证据
        ↓
构造 EvalCase / Dataset
        ↓
选择 Evaluator
        ↓
运行 Agent + 采集 Trace
        ↓
Outcome / State / Trajectory / Safety
        ↓
多次运行与不确定性
        ↓
Regression / Release Gate
        ↓
Production Online Eval

Hands-on Labs

本站建议所有实验在本地或隔离的测试环境中运行。不要为了学习 Eval 而把测试 Agent 直接连接生产数据库、生产 Kubernetes 或真实客户系统。

每一个 Lab 至少保存:

  • EvalCase 版本
  • Agent / Model / Prompt / Tool 版本
  • Environment Snapshot
  • 原始 Trace
  • Scorer 输出
  • 聚合指标
  • 失败分类
  • 成本与延迟
  • 结论与适用边界

主线 Lab 可以直接运行:

make agent-eval-lab-smoke
make agent-eval-lab-report LAB_RUNS=5
make agent-eval-lab-gate LAB_RUNS=5
010. 如何使用这份手册021. Agent Evaluation 全景图032. 为什么 LLM Eval 不等于 Agent Eval043. Agent Evaluation Lifecycle054. 证据模型:到底什么能证明 Agent 做对了065. 评测对象、系统边界与可观察性076. Task Outcome 与 Success Criteria087. EvalCase 与 Dataset 设计098. 数据切分、泄漏、污染与版本化109. Deterministic Evaluation:先把能确定的事情确定下来1110. State-based Evaluation:检查世界是否真的被正确改变1211. Tool Use Evaluation:工具选择、参数、执行与结果处理1312. Trajectory 与 Planning Evaluation1413. LLM-as-a-Judge:强大,但必须被校准1514. Rubric Engineering:把“感觉不错”变成评价标准1615. Human Evaluation:把人类判断变成可靠数据1716. Reliability:一次成功不等于可靠1817. Efficiency:延迟、Token、Tool 与 Cost per Success1918. Agent Safety 与 Prompt Injection2019. Multi-Agent Evaluation2120. Online Evaluation 与 Production Monitoring2221. Regression Testing 与 Release Gate2322. Evaluating the Evaluator:评测器也必须被评测2423. 如何设计一个可信的 Agent Benchmark2524. AgentBench、AgentBoard 与 GAIA:通用 Agent Benchmark 怎么看2625. τ-bench 与 τ²-bench:Tool-Agent-User Interaction 的典型方法2726. WebArena 与 BrowserGym:Web Agent 的可复现环境2827. SWE-bench:执行结果驱动的 Coding Agent 评测2928. ToolBench、StableToolBench 与 BFCL:如何评 Function Calling3029. AgentDojo、Agent-SafetyBench 与 OpenAgentSafety3130. Inspect AI:定位、架构与适用边界3231. Inspect Core:Task、Dataset、Sample、Solver 与 Scorer3332. Inspect Agent、Tool、Sandbox 与外部 Agent3433. Inspect EvalLog、Trace、Hook、EvalSet 与 Extension3534. Inspect AI + GoClaw:Evaluation Runtime 与 Control Plane3635. 完整实战:从一个 Agent 到 Release Gate3736. 企业案例:Customer Service Agent 与 Kubernetes Agent3837. 论文阅读地图与 Benchmark Card3938. 模板、Failure Taxonomy 与术语速查4039. 实践主线:从零启动一个可评测的客服 Agent4140. 实践主线:实现可诊断的 Scorer4241. 实践主线:重复运行、故障注入与回归门禁4342. 实践主线:把 Reference Adapter 换成真实 Agent4443. 综合作业:为自己的 Agent 建立第一条 Release Pipeline

HANDS-ON LABS

在隔离环境中复现实验

本站不托管 Agent、Jupyter 或生产数据。模板、论文索引和实验材料作为静态资源提供下载,请在本地或专用测试环境运行。

运行最小 Eval Lab →