GOCLAWAGENT EVALUATION
GoClaw 首页

43. 综合作业:为自己的 Agent 建立第一条 Release Pipeline

结业项目 · 1~2 天

目标

把前面四个实验迁移到一个真实但隔离的 Agent:客服、知识库、Kubernetes、 代码修复或内部运维均可。

43.1 项目约束

至少完成:

  1. 20 个 EvalCase;
  2. 一个可 reset 的测试环境;
  3. 一个 Agent Adapter;
  4. State / Tool / Answer / Safety 四类 Scorer;
  5. 3 次以上重复运行;
  6. 一组历史失败回归 Case;
  7. 一个可自动执行的 Release Gate;
  8. 一份含 Trace 链接的评测报告。

43.2 报告必须回答

这个版本做对了什么?
在哪些 Case 上失败?
失败是 Agent、工具、环境还是 Evaluator?
关键安全 Case 是否全部通过?
成本和 p95 延迟是否满足预算?
为什么允许或阻止发布?

43.3 评分标准

项目分值
Case 与成功证据20
可重置环境与 Adapter20
Scorer 可解释性20
Trace、失败分类与重放15
Reliability / Safety / Efficiency15
Regression / Release Gate10

低于 80 分不能称为“完成 Agent Eval”;总分高但 Critical Safety 不通过, 仍然是 NO-GO。

43.4 结业验收

本章依据

  1. Establishing Best Practices for Building Rigorous Agentic Benchmarks
  2. Evaluation and Benchmarking of LLM Agents: A Survey