GOCLAWAGENT EVALUATION
GoClaw 首页

1. Agent Evaluation 全景图

基础方法论 · 1~2 小时

学习目标

  1. 建立 Agent Evaluation 的完整知识地图
  2. 区分能力评测、产品评测与生产评测
  3. 理解评测对象与评测过程两个正交维度

前置知识

本章产物: 画出自己的 Agent Evaluation Landscape,并标注当前产品已有/缺失能力。

1.1 为什么 Agent Evaluation 比模型评测复杂

传统模型评测通常固定输入、调用模型、得到输出,然后比较答案。Agent 会在执行过程中改变自己的上下文和外部环境,因此它是一个交互系统

同一个任务可能因为:

而产生不同轨迹。

因此 Agent Evaluation 的关键对象不再只是 (input, output),而是:

(initial state, task, policy)
        ↓
interaction trajectory
        ↓
(final state, answer, artifacts)

1.2 两个正交维度:What 与 How

一个实用的分类方式是把评测问题拆成两个维度。

What to evaluate

How to evaluate

不要把“评什么”和“怎么评”混在一起。例如“Tool Use”是对象,“AST 校验”或“执行 API 后检查数据库”才是方法。

1.3 三个层级

Capability Eval

回答:“这个 Agent 具备什么能力?”

典型工具:公开 Benchmark。

Product Eval

回答:“我的 Agent 产品在定义好的真实场景下是否足够好?”

典型方法:私有 EvalSuite、状态验证、历史失败集。

Production Eval

回答:“上线以后是否发生 Drift、Regression、异常和安全问题?”

典型方法:Trace Sampling、Shadow Eval、线上指标和 Incident Replay。

1.4 Agent Evaluation Pyramid

L7 Production / Online
L6 Safety / Compliance
L5 Reliability / Repeated Runs
L4 Environment State
L3 Trajectory / Tool / Recovery
L2 Task Outcome / Progress
L1 Component / Model / Skill

金字塔不是“越高越高级”,而是不同粒度的证据。一个生产 Release Gate 常常同时要求 L2、L4、L5、L6 和系统指标。

1.5 评测结果不要坍缩成一个分数

推荐 Scorecard:

维度指标
OutcomeTask Success Rate
StateFinal State Accuracy
ToolSelection / Argument / Execution
TrajectoryViolation / Loop / Redundancy
Reliabilitypass^k / variance
SafetyUnsafe Action Rate
EfficiencyP50/P95 latency, cost/success

Overall Score 可以用于展示,但不能让 Safety 被其他指标平均“抵消”。

1.6 本章实验

选一个你熟悉的 Agent,把每个已有指标放到 What/How 矩阵中。如果某个指标无法说明它评的对象和证据来源,就先标记为“不可解释指标”。

1.7 验收问题


本章依据

原理性结论优先来自原始论文和官方文档。论文中的实验数字只属于论文声明的模型、数据、环境和评测设置,不能直接外推为你的生产结论。

  1. Evaluation and Benchmarking of LLM Agents: A Survey — Mohammadi et al., 2025
  2. An Evaluation-Driven Approach to Designing LLM Agents: Process and Architecture — Xia et al., 2024/2025