GOCLAWAGENT EVALUATION
GoClaw 首页

20. Online Evaluation 与 Production Monitoring

生产评测 · 4~6 小时

学习目标

  1. 区分离线 Eval 与线上 Eval
  2. 设计 Sampling、Shadow Scoring、Drift 与 Incident Replay
  3. 控制隐私、成本与反馈偏差

前置知识

本章产物: 设计一套 Online Eval Pipeline。

20.1 Offline 与 Online 解决不同问题

Offline:

Online:

成熟系统需要二者闭环。

20.2 Sampling

不是所有生产 Run 都进入昂贵 Judge。

可以按:

random sample
risk-based sample
new feature sample
error sample
long-tail sample
high-cost sample

20.3 Shadow Evaluation

线上 Agent 不改变,但旁路 Evaluator:

Production Trace
      ↓
Async Evaluator
      ↓
Score / Alert / Dataset Candidate

不要让非必要 Judge 增加用户请求关键路径延迟。

20.4 Drift

监控:

Drift ≠ Regression。用户分布变了也会导致指标变化。

20.5 Weak Labels

生产环境没有每条任务的 Ground Truth。

可以使用:

这些是弱证据,必须明确边界。

20.6 Incident Replay

线上事故要冻结:

sanitized input
initial state
tool responses
policy
expected correct behavior

然后变成离线 EvalCase。

20.7 Privacy

Eval 平台可能保存最完整的 Trace,因此必须:

20.8 验收问题


本章依据

  1. An Evaluation-Driven Approach to Designing LLM Agents: Process and Architecture — Xia et al.
  2. AlphaEval: Evaluating Agents in Production — Lu et al., 2026
  3. Evaluation and Benchmarking of LLM Agents: A Survey — Mohammadi et al., 2025