19. Multi-Agent Evaluation
高级方法论 · 3~4 小时
学习目标
- 识别多 Agent 带来的新故障模式
- 评估分工、通信、委派与整体结果
- 避免只评每个子 Agent 的局部得分
前置知识
- 第 12、16 章
- 了解多 Agent 架构
本章产物: 为一个 Planner/Researcher/Executor 系统设计多 Agent Eval。
19.1 多 Agent 不是 N 个单 Agent 分数相加
整体失败可能来自:
- 错误委派;
- 信息在 Agent 间丢失;
- 重复工作;
- 冲突;
- Supervisor 错误合并;
- Subagent 成功但主 Agent 不使用结果。
因此必须评:
Team Outcome
+
Coordination
+
Subtask Quality19.2 Delegation Quality
检查:
- 是否需要委派;
- 选对 Subagent;
- 输入是否完整;
- 是否传递约束;
- 是否消费返回结果。
19.3 Communication
多 Agent Trace 应保留:
sender
receiver
message type
task id
artifact refs
timestamps否则无法判断错误在哪一跳出现。
19.4 Redundant Work
两个 Subagent 都做完全相同搜索,可能提高鲁棒性,也可能是浪费。
是否冗余要结合设计意图评。
19.5 Credit Assignment
团队失败时,不要简单给所有 Agent 0 分。
可以区分:
planner failure
delegate failure
tool failure
aggregation failure这对迭代很重要。
19.6 Team Reliability
多 Agent 链路越长,局部不可靠可能累积。
所以要评:
- subtask pass rate;
- full task pass rate;
- retry;
- message loss / malformed handoff;
- long-horizon consistency。
19.7 验收问题
- 为什么局部 Agent 都成功,整体仍可能失败?
- 怎样评价 Delegation?
- 多 Agent Failure Attribution 为什么重要?