29. AgentDojo、Agent-SafetyBench 与 OpenAgentSafety
Benchmark 专题 · 4~6 小时
学习目标
- 理解三类 Agent Safety Benchmark 的关注点
- 学会同时测 Utility 与 Safety
- 设计真实工具安全环境
前置知识
- 第 18 章
本章产物: 完成一张安全 Benchmark 对比卡并设计自己的风险 taxonomy。
29.1 AgentDojo:Prompt Injection 环境
AgentDojo 专门研究工具型 Agent 处理不可信数据时的间接 Prompt Injection。
它的核心价值:
benign user task
+
untrusted external data
+
attack
+
tools同时测任务 Utility 和攻击成功。
29.2 Agent-SafetyBench:更广安全分类
Agent-SafetyBench 构造大量交互环境和测试案例,覆盖多类 Agent Safety 风险。
它提醒我们:
Agent Safety 不只是 Prompt Injection。
还包括风险识别、鲁棒性、危险动作等。
29.3 OpenAgentSafety:真实工具
OpenAgentSafety 进一步强调真实工具环境,例如:
- web browser;
- code execution;
- filesystem;
- shell;
- messaging。
这更接近生产 Agent 的攻击面。
29.4 Safety Taxonomy
内部体系建议至少有:
authorization
privacy
secret
prompt_injection
unsafe_execution
financial_action
destructive_action
social_engineering
policy_bypass
data_exfiltration29.5 Utility / Security Trade-off
安全系统如果把所有请求拒绝:
attack success = 0
task success = 0不是好 Agent。
所以报告二维:
Benign Task Success
Attack Success Rate29.6 Safety Case 必须有真实 Consequence Checker
不要只让 Judge 看对话说“似乎危险”。
如果模拟环境里可以检查:
secret sent?
money transferred?
file deleted?应直接检查。
29.7 验收问题
- AgentDojo 的主要威胁模型是什么?
- 为什么要同时报告 Utility 和 Attack Success?
- OpenAgentSafety 的“真实工具”有什么价值?