GOCLAWAGENT EVALUATION
GoClaw 首页

0. 如何使用这份手册

导学 · 45~60 分钟

学习目标

  1. 建立 Agent Evaluation 的正确预期
  2. 理解贯穿整本手册的证据优先原则
  3. 建立个人 Eval Lab 与实验记录方式

前置知识

本章产物: 创建 agent-eval-lab/ 实验目录和第一份 Eval Report。

0.1 先建立正确预期

Agent Evaluation 不是“给回答打一个 0~10 分”。当系统具备工具、环境、记忆、循环和外部副作用后,最终文本只是可观察结果中的一小部分。

一个典型 Agent Run 可以抽象成:

因此你至少要回答六类问题:

  1. 结果对不对? —— Task Outcome。
  2. 真实世界是否被正确改变? —— State。
  3. 工具是否选对、参数是否正确? —— Tool Use。
  4. 过程是否违规、循环或走捷径? —— Trajectory / Policy。
  5. 同一任务重复运行是否仍然可靠? —— Reliability。
  6. 成本、延迟和风险是否可接受? —— Efficiency / Safety。

不要把公开 Benchmark 当成生产验收

公开 Benchmark 的价值是可比较、可复现和研究交流;你的生产 Eval 的价值是回答“这个版本能否在我的用户、工具、数据、权限和 SLA 下上线”。

二者应该同时存在:

Public Benchmark  → 能力参考
Private Eval      → 产品真实质量
Production Replay → 长尾与回归

0.2 三条学习线并行推进

学习线核心问题实践
方法论什么算成功?什么证据可信?Success Criteria、EvalCase、Rubric
评测技术如何自动判断结果和过程?State、Tool、Trajectory、Judge
工程线如何持续跑、比较、回归、发布?Inspect、Experiment、Release Gate

0.3 证据优先原则

每次评测尽量保存:

Case Version
Agent Version
Model / Prompt / Tool Version
Environment Version
Raw Trace
Final State
Scores
Cost / Latency
Failure Type
Conclusion Boundary

如果只有一个“87.3 分”,但无法回到逐样本结果解释为什么是 87.3,这个 Eval 的工程价值有限。

0.4 建立实验目录

agent-eval-lab/
├── cases/
├── datasets/
├── agents/
├── scorers/
├── environments/
├── traces/
├── reports/
├── baselines/
└── experiments/

不要只保存聚合指标。建议逐 Run 写 JSONL:

{
  "case_id": "order-cancel-001",
  "agent_version": "v0.8.3",
  "run_id": "run-...",
  "task_success": true,
  "state_score": 1.0,
  "tool_score": 0.92,
  "safety_score": 1.0,
  "latency_ms": 8400,
  "tool_calls": 4,
  "failure_type": null
}

0.5 学完后的验收标准

完成整本手册后,你应该能够:

0.6 第一次学习会话

第一次不要安装十几个框架。只做:

  1. 阅读第 0~3 章;
  2. 选择一个已经存在的简单 Agent;
  3. 写 10 个 EvalCase;
  4. 明确每个 Case 的成功证据;
  5. 手工执行 3 个 Case 并记录 Trace;
  6. 观察“最终回答正确”和“最终状态正确”是否完全一致。

0.7 导学验收


本章依据

原理性结论优先来自原始论文和官方文档。论文中的实验数字只属于论文声明的模型、数据、环境和评测设置,不能直接外推为你的生产结论。

  1. Evaluation and Benchmarking of LLM Agents: A Survey — Mohammadi et al., 2025
  2. An Evaluation-Driven Approach to Designing LLM Agents: Process and Architecture — Xia et al., 2024/2025
  3. AlphaEval: Evaluating Agents in Production — Lu et al., 2026