GOCLAWAGENT EVALUATION
GoClaw 首页

38. 模板、Failure Taxonomy 与术语速查

学习与参考 · 随用随查

学习目标

  1. 掌握统一 Eval Spec
  2. 使用 Failure Taxonomy 做回归分析
  3. 快速查阅核心术语

前置知识

本章产物: 复制模板开始自己的 Eval 项目。

38.1 EvalCase Template

id: case-001
suite: customer-service
version: 1

task:
  input: "..."
  category: refund
  risk: high

environment:
  fixture: retail-v12
  reset: per_case

expected:
  required_effects: []
  forbidden_effects: []
  answer_requirements: []

policy:
  version: policy-v3

limits:
  turns: 15
  tool_calls: 20
  timeout_seconds: 60

evaluators:
  - state
  - tool
  - policy
  - answer

38.2 Experiment Template

experiment:
  id: exp-2026-001

baseline:
  agent: 0.8.1

candidate:
  agent: 0.9.0

suite:
  name: customer-service
  version: 1.4.0

epochs:
  normal: 3
  critical: 10

38.3 Failure Taxonomy

一级:

task_understanding
planning
tool_selection
argument
execution
result_interpretation
state
policy
safety
recovery
loop
answer
environment
evaluator

二级可按领域扩展。

38.4 Release Report

Summary
Configuration
Version Matrix
Dataset
Scorecard
Reliability
Safety
Efficiency
Regression
Failure Analysis
Known Limitations
Decision
Evidence Links

38.5 术语

EvalSuite

为某个质量目标组织的一组 EvalCase。

EvalCase

最小可执行评测场景。

AgentRun / SampleRun

Agent 对一个 Case 的一次独立执行。

Trace

可观察的消息、动作、工具、环境事件序列。

Scorer / Evaluator

把 Run 证据转换成 Score / Label 的逻辑。

State-based Evaluation

通过环境状态验证任务结果。

Trajectory Evaluation

评价动作过程、顺序、策略和恢复。

LLM-as-a-Judge

让模型按照 Rubric 评价输出或过程。

pass@k

k 个候选中至少有一个成功的能力型指标。

pass^k

强调多次执行持续成功的可靠性思想。

Regression

新版本相对 Baseline 的质量退化。

Release Gate

自动决定是否允许发布的质量门槛。

Environment

Agent 操作和观察的外部世界,包括服务、数据库、文件、浏览器等。

Sandbox

提供隔离执行能力的环境组件,不等价于完整业务 Environment。

Benchmark Validity

Benchmark 的任务和 Evaluator 是否真的测到了声称要测的能力。

38.6 最终工程原则

Outcome first
State when possible
Trajectory when necessary
Deterministic before Judge
Judge must be calibrated
Repeat stochastic tasks
Safety is a gate
Every failure becomes a future test
Version everything
Keep raw evidence

本章依据

  1. Establishing Best Practices for Building Rigorous Agentic Benchmarks — Zhu et al., 2025
  2. $\tau$-bench — Yao et al., 2024
  3. Inspect AI 官方文档