GOCLAWAGENT EVALUATION
GoClaw 首页

8. 数据切分、泄漏、污染与版本化

核心工程 · 2~3 小时

学习目标

  1. 避免测试集被开发过程污染
  2. 理解 Benchmark contamination 与环境漂移
  3. 建立 Dataset / Evaluator / Environment Version

前置知识

本章产物: 给现有 EvalSuite 建立版本清单和 Holdout 策略。

8.1 Test 反复看,就不再是 Test

如果团队每天看同一批“隐藏测试”结果并针对失败调 Prompt,这批数据实际上已经成为 Validation。

推荐:

Development Set
Validation / Regression Set
Release Holdout
Production Shadow Set

8.2 Agent Eval 的泄漏比传统 ML 更复杂

泄漏可能来自:

8.3 环境泄漏

Case A 创建文件,Case B 恰好读取这个文件,就会产生顺序依赖。

所以每个 Case 必须回答:

environment isolation?
reset strategy?
seed?
shared mutable state?

8.4 Dataset Version

建议 SemVer 或不可变 digest:

customer-service-eval@1.4.0
sha256:...

修改 Case expected state 不是“无影响的文档修改”,它会改变历史分数含义。

8.5 Benchmark Contamination

公开 Benchmark 可能进入模型训练数据。遇到异常高分时,不应直接证明“泛化能力”。

可以增加:

8.6 Eval Result 必须绑定版本

suite: customer-service@1.4.0
agent: 0.9.1
model: provider/model@revision
evaluator: state-checker@2.1.0
environment: retail-fixture@12

没有版本信息的历史曲线很容易失去意义。

8.7 验收问题


本章依据

原理性结论优先来自原始论文和官方文档。论文中的实验数字只属于论文声明的模型、数据、环境和评测设置,不能直接外推为你的生产结论。

  1. Establishing Best Practices for Building Rigorous Agentic Benchmarks — Zhu et al., 2025
  2. StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models — Guo et al., 2024
  3. GAIA: a benchmark for General AI Assistants — Mialon et al., 2023