GOCLAWAGENT EVALUATION
GoClaw 首页

17. Efficiency:延迟、Token、Tool 与 Cost per Success

生产评测 · 2~3 小时

学习目标

  1. 建立 Agent 成本与性能指标
  2. 理解成功率和效率的联合优化
  3. 计算 Cost per Successful Task

前置知识

本章产物: 完成一份 Agent Efficiency Scorecard。

17.1 两个都成功的 Agent 不一定一样好

Agent A:

5 model calls
4 tool calls
8 seconds
$0.08

Agent B:

28 model calls
21 tool calls
70 seconds
$1.50

如果成功率相同,产品价值差异巨大。

17.2 基本指标

Latency

Token

Tool

Cost

17.3 Cost per Success

推荐:

total evaluation cost
---------------------
successful tasks

而不是只看平均每 Run cost。

失败 Agent 很便宜没有意义。

17.4 Quality / Cost Frontier

比较版本时画:

Task Success ↔ Cost
Task Success ↔ Latency
Reliability  ↔ Cost

找到 Pareto Frontier。

17.5 Budget Constraint

Case 可以定义:

limits:
  max_turns: 15
  max_tool_calls: 20
  max_tokens: 50000
  max_cost_usd: 0.50
  timeout_seconds: 90

超预算可以是独立失败类型,不一定和 Task Failure 合并。

17.6 长任务的“资源放大”

一个 Agent 如果陷入循环,会同时造成:

因此效率评测也是可靠性与安全的一部分。

17.7 验收问题


本章依据

  1. Evaluation and Benchmarking of LLM Agents: A Survey — Mohammadi et al., 2025
  2. AlphaEval: Evaluating Agents in Production — Lu et al., 2026