20. Online Evaluation 与 Production Monitoring
生产评测 · 4~6 小时
学习目标
- 区分离线 Eval 与线上 Eval
- 设计 Sampling、Shadow Scoring、Drift 与 Incident Replay
- 控制隐私、成本与反馈偏差
前置知识
- 第 3、16~19 章
- 生产可观测性基础
本章产物: 设计一套 Online Eval Pipeline。
20.1 Offline 与 Online 解决不同问题
Offline:
- 可重复;
- 有参考;
- 用于版本比较。
Online:
- 真实用户;
- 真实长尾;
- 环境动态;
- 可发现未知失败。
成熟系统需要二者闭环。
20.2 Sampling
不是所有生产 Run 都进入昂贵 Judge。
可以按:
random sample
risk-based sample
new feature sample
error sample
long-tail sample
high-cost sample20.3 Shadow Evaluation
线上 Agent 不改变,但旁路 Evaluator:
Production Trace
↓
Async Evaluator
↓
Score / Alert / Dataset Candidate不要让非必要 Judge 增加用户请求关键路径延迟。
20.4 Drift
监控:
- Task mix;
- tool mix;
- user language;
- length;
- failure category;
- cost;
- success proxy;
- Judge score。
Drift ≠ Regression。用户分布变了也会导致指标变化。
20.5 Weak Labels
生产环境没有每条任务的 Ground Truth。
可以使用:
- tool receipts;
- user correction;
- abandonment;
- rollback;
- repeated request;
- human escalation;
- downstream state。
这些是弱证据,必须明确边界。
20.6 Incident Replay
线上事故要冻结:
sanitized input
initial state
tool responses
policy
expected correct behavior然后变成离线 EvalCase。
20.7 Privacy
Eval 平台可能保存最完整的 Trace,因此必须:
- 数据最小化;
- Secret redaction;
- retention;
- tenant isolation;
- access control;
- PII policy。
20.8 验收问题
- 为什么 Online Judge 不应默认在同步关键路径?
- Drift 与 Regression 有什么不同?
- Weak Label 怎样转成可信回归 Case?