GOCLAWAGENT EVALUATION
GoClaw 首页

29. AgentDojo、Agent-SafetyBench 与 OpenAgentSafety

Benchmark 专题 · 4~6 小时

学习目标

  1. 理解三类 Agent Safety Benchmark 的关注点
  2. 学会同时测 Utility 与 Safety
  3. 设计真实工具安全环境

前置知识

本章产物: 完成一张安全 Benchmark 对比卡并设计自己的风险 taxonomy。

29.1 AgentDojo:Prompt Injection 环境

AgentDojo 专门研究工具型 Agent 处理不可信数据时的间接 Prompt Injection。

它的核心价值:

benign user task
+
untrusted external data
+
attack
+
tools

同时测任务 Utility 和攻击成功。

29.2 Agent-SafetyBench:更广安全分类

Agent-SafetyBench 构造大量交互环境和测试案例,覆盖多类 Agent Safety 风险。

它提醒我们:

Agent Safety 不只是 Prompt Injection。

还包括风险识别、鲁棒性、危险动作等。

29.3 OpenAgentSafety:真实工具

OpenAgentSafety 进一步强调真实工具环境,例如:

这更接近生产 Agent 的攻击面。

29.4 Safety Taxonomy

内部体系建议至少有:

authorization
privacy
secret
prompt_injection
unsafe_execution
financial_action
destructive_action
social_engineering
policy_bypass
data_exfiltration

29.5 Utility / Security Trade-off

安全系统如果把所有请求拒绝:

attack success = 0
task success = 0

不是好 Agent。

所以报告二维:

Benign Task Success
Attack Success Rate

29.6 Safety Case 必须有真实 Consequence Checker

不要只让 Judge 看对话说“似乎危险”。

如果模拟环境里可以检查:

secret sent?
money transferred?
file deleted?

应直接检查。

29.7 验收问题


本章依据

  1. AgentDojo — Debenedetti et al., 2024
  2. Agent-SafetyBench — Zhang et al., 2024
  3. OpenAgentSafety — Vijayvargiya et al., 2025