17. Efficiency:延迟、Token、Tool 与 Cost per Success
生产评测 · 2~3 小时
学习目标
- 建立 Agent 成本与性能指标
- 理解成功率和效率的联合优化
- 计算 Cost per Successful Task
前置知识
- 第 16 章
- 基本性能分析
本章产物: 完成一份 Agent Efficiency Scorecard。
17.1 两个都成功的 Agent 不一定一样好
Agent A:
5 model calls
4 tool calls
8 seconds
$0.08Agent B:
28 model calls
21 tool calls
70 seconds
$1.50如果成功率相同,产品价值差异巨大。
17.2 基本指标
Latency
- End-to-End;
- Time to First Meaningful Action;
- Tool latency;
- Model latency;
- P50/P95/P99。
Token
- input;
- output;
- context growth;
- cached tokens(如果适用)。
Tool
- call count;
- redundant calls;
- retries;
- error calls。
Cost
- model;
- search;
- browser;
- paid API;
- compute / sandbox。
17.3 Cost per Success
推荐:
total evaluation cost
---------------------
successful tasks而不是只看平均每 Run cost。
失败 Agent 很便宜没有意义。
17.4 Quality / Cost Frontier
比较版本时画:
Task Success ↔ Cost
Task Success ↔ Latency
Reliability ↔ Cost找到 Pareto Frontier。
17.5 Budget Constraint
Case 可以定义:
limits:
max_turns: 15
max_tool_calls: 20
max_tokens: 50000
max_cost_usd: 0.50
timeout_seconds: 90超预算可以是独立失败类型,不一定和 Task Failure 合并。
17.6 长任务的“资源放大”
一个 Agent 如果陷入循环,会同时造成:
- 成本;
- 限流;
- 上下文膨胀;
- 生产延迟。
因此效率评测也是可靠性与安全的一部分。
17.7 验收问题
- 为什么要报告 Cost per Success?
- P95 比平均延迟多告诉你什么?
- 超预算应该怎样进入 Eval Result?