GOCLAWAGENT EVALUATION
GoClaw 首页

14. Rubric Engineering:把“感觉不错”变成评价标准

Evaluator 技术 · 2~3 小时

学习目标

  1. 写出可执行 Rubric
  2. 区分 Must-have 与 Quality Dimension
  3. 降低 Judge 评分漂移

前置知识

本章产物: 为一个开放任务写出 4 维 Rubric 与评分锚点。

14.1 Rubric 是评价契约

差的 Rubric:

回答是否高质量?1~5 分。

好的 Rubric:

Correctness
Completeness
Constraint Compliance
Actionability

每个维度有清晰 anchor。

14.2 先 Hard Gate,再 Quality

例如投资报告:

Hard Gate

Quality

如果引用造假,不能靠“结构很好”平均回来。

14.3 评分锚点

例 Completeness:

5: 所有要求均覆盖,无关键遗漏
4: 仅次要细节遗漏
3: 至少一个重要部分不足
2: 多个关键部分缺失
1: 未完成主要目标

锚点应让不同 Reviewer 对相同案例有接近判断。

14.4 Rubric 不要混多个概念

例如:

“准确、完整、简洁、友好程度”

写成一个维度,会导致 Judge 无法解释为什么是 3 分。

拆开后才能分析 Regression。

14.5 从真实失败构造 Rubric

如果用户不断抱怨“虽然回答正确,但没有告诉我下一步怎么做”,可以新增:

Actionability

Rubric 应由真实产品需求进化。

14.6 Rubric Versioning

research-report-rubric@2.3.0

修改规则后,不要直接把新旧平均分连在同一趋势线上。

14.7 验收问题


本章依据

  1. AlphaEval: Evaluating Agents in Production — Lu et al., 2026
  2. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena — Zheng et al., 2023