38. 模板、Failure Taxonomy 与术语速查
学习与参考 · 随用随查
学习目标
- 掌握统一 Eval Spec
- 使用 Failure Taxonomy 做回归分析
- 快速查阅核心术语
前置知识
- 全书
本章产物: 复制模板开始自己的 Eval 项目。
38.1 EvalCase Template
id: case-001
suite: customer-service
version: 1
task:
input: "..."
category: refund
risk: high
environment:
fixture: retail-v12
reset: per_case
expected:
required_effects: []
forbidden_effects: []
answer_requirements: []
policy:
version: policy-v3
limits:
turns: 15
tool_calls: 20
timeout_seconds: 60
evaluators:
- state
- tool
- policy
- answer38.2 Experiment Template
experiment:
id: exp-2026-001
baseline:
agent: 0.8.1
candidate:
agent: 0.9.0
suite:
name: customer-service
version: 1.4.0
epochs:
normal: 3
critical: 1038.3 Failure Taxonomy
一级:
task_understanding
planning
tool_selection
argument
execution
result_interpretation
state
policy
safety
recovery
loop
answer
environment
evaluator二级可按领域扩展。
38.4 Release Report
Summary
Configuration
Version Matrix
Dataset
Scorecard
Reliability
Safety
Efficiency
Regression
Failure Analysis
Known Limitations
Decision
Evidence Links38.5 术语
EvalSuite
为某个质量目标组织的一组 EvalCase。
EvalCase
最小可执行评测场景。
AgentRun / SampleRun
Agent 对一个 Case 的一次独立执行。
Trace
可观察的消息、动作、工具、环境事件序列。
Scorer / Evaluator
把 Run 证据转换成 Score / Label 的逻辑。
State-based Evaluation
通过环境状态验证任务结果。
Trajectory Evaluation
评价动作过程、顺序、策略和恢复。
LLM-as-a-Judge
让模型按照 Rubric 评价输出或过程。
pass@k
k 个候选中至少有一个成功的能力型指标。
pass^k
强调多次执行持续成功的可靠性思想。
Regression
新版本相对 Baseline 的质量退化。
Release Gate
自动决定是否允许发布的质量门槛。
Environment
Agent 操作和观察的外部世界,包括服务、数据库、文件、浏览器等。
Sandbox
提供隔离执行能力的环境组件,不等价于完整业务 Environment。
Benchmark Validity
Benchmark 的任务和 Evaluator 是否真的测到了声称要测的能力。
38.6 最终工程原则
Outcome first
State when possible
Trajectory when necessary
Deterministic before Judge
Judge must be calibrated
Repeat stochastic tasks
Safety is a gate
Every failure becomes a future test
Version everything
Keep raw evidence