30. Inspect AI:定位、架构与适用边界
Inspect AI · 2~3 小时
学习目标
- 理解 Inspect AI 主要解决什么问题
- 把 Inspect 定位为 Evaluation Runtime 而不是完整平台
- 认识 MIT License 与扩展机制
前置知识
- 前面方法论章节至少读到第 13 章
- Python 基础
本章产物: 安装 Inspect 并运行官方 Hello Eval。
30.1 Inspect AI 的定位
Inspect AI 是 UK AI Security Institute 开发的开源 LLM Evaluation Framework。
核心抽象非常清晰:
Task
├── Dataset / Samples
├── Solver / Agent
└── Scorer再配合:
Tools
Sandbox
Eval Log
Trace
Hooks
Extensions它已经覆盖了大量 Eval Execution 基础设施。
30.2 我们为什么值得直接引入
如果自己从零实现:
- 并发 Sample;
- Model Provider;
- Tool Harness;
- Sandbox;
- Retry;
- Logs;
- Scoring;
- Viewer;
成本很高,而且会分散精力。
Inspect 更适合作为:
Evaluation Runtime / Execution Engine。
我们自己的平台继续负责:
- EvalSuite;
- Experiment;
- Baseline;
- Regression;
- Release Gate;
- Online Eval;
- Governance。
30.3 Inspect 不是什么
它不是完整企业 Eval Control Plane。
它不会天然替你定义:
- 公司的质量方法论;
- Release Policy;
- Multi-tenant governance;
- 历史生产事故闭环;
- Benchmark license governance。
所以“引入 Inspect”和“放弃自己做 Eval Platform”不是一回事。
30.4 License
Inspect AI 官方仓库采用 MIT License。通常允许使用、修改、分发和商业集成,同时需要保留许可证要求。
注意:
Inspect Framework 的 MIT,不代表所有 Inspect Evals 中引用的第三方 Benchmark/Dataset 都是 MIT。
每个数据资产需要单独检查许可证。
30.5 Extension-first
不建议 Fork Inspect Core。
优先:
upstream Inspect
+
inspect-goclaw extensionInspect 官方支持第三方 Python package 通过 extension entry point 扩展 component、sandbox、hook 等。
30.6 验收问题
- Inspect 解决的是平台哪一层?
- 为什么不建议 Fork Core?
- Inspect MIT 为什么不能自动推出所有 Benchmark 可商业分发?