32. Inspect Agent、Tool、Sandbox 与外部 Agent
Inspect AI · 4~6 小时
学习目标
- 使用 Inspect Agent Protocol
- 理解 Tool 与 Sandbox 的边界
- 接入外部 Agent 而不是重写 Agent Runtime
前置知识
- 第 31 章
- Docker 基础可选
本章产物: 用 Inspect 运行一个具备工具调用的外部 Agent。
32.1 Inspect Agent Protocol
Inspect 支持:
- 内置 ReAct;
- custom agent;
- multi-agent;
- external agent bridge;
- human agent。
这意味着被测 Agent 不必使用 Inspect 自己实现。
32.2 External Agent
我们的正确关系:
Inspect Runner
↓
Agent Adapter
↓
Your Agent API / CLI
↓
Agent Runtime这样评测工具不侵入 Agent 产品架构。
32.3 Tool
Inspect Tool 模型是:
model generates structured tool request
↓
Inspect invokes tool
↓
tool result returned适合构造可控测试工具。
32.4 Sandbox
对:
- code agent;
- terminal agent;
- file agent;
- cyber eval;
必须隔离。
Inspect 提供 sandbox abstraction,可用 Docker,也可扩展其他 provider。
32.5 Environment ≠ Sandbox
Sandbox 是执行隔离容器;Environment 还包括:
- DB;
- service;
- fixtures;
- user simulator;
- time;
- network。
不要把两者概念混淆。
32.6 Human Agent
Inspect 允许人类在相同 Task / Sandbox / Scorer 下执行,这对 Human Baseline 很有价值。
32.7 Limits
长 Agent 必须有:
turn limit
message limit
token limit
time limitEval 不应因为 Agent 循环无限跑。
32.8 验收问题
- 为什么 External Agent Adapter 比重写 Agent 更好?
- Sandbox 与完整 Environment 有何区别?
- Human Agent 能用于什么质量验证?