GOCLAWAGENT EVALUATION
GoClaw 首页

34. Inspect AI + GoClaw:Evaluation Runtime 与 Control Plane

架构实践 · 4~6 小时

学习目标

  1. 明确 Inspect 与自研平台的产品边界
  2. 设计 inspect-goclaw extension
  3. 把 EvalRun 映射成可调度 Workload

前置知识

本章产物: 完成 Agent Evaluation Platform v1 架构图和接口清单。

34.1 最推荐的边界

Agent Evaluation Platform
        ↓
EvalSuite / Experiment / Baseline
Regression / ReleaseGate
        ↓
Inspect Runner
        ↓
Agent / Tools / Sandbox / Scorers

Inspect 负责 Execution Engine,上层平台负责产品与治理。

34.2 为什么这和 GoClaw Control Plane 契合

Eval 天然是大规模并行 Workload:

1 Suite
 ↓
10 Tasks
 ↓
10,000 Samples
 ↓
multiple epochs
 ↓
sandbox / model / tools

所以可以:

AIWorkload(type=evaluation)
      ↓
GoClaw Placement
      ↓
Kubernetes Cluster
      ↓
Inspect Runner

34.3 inspect-goclaw Extension

GoclawAgent

调用已有 Agent Runtime。

GoclawScorer

查询企业状态:

GoclawSandbox

把 Inspect Sandbox 生命周期映射到 GoClaw/Kubernetes。

GoclawHook

把 Eval 生命周期事件发送到 Control Plane。

34.4 Go 平台核心对象

EvalSuite
EvalDataset
EvalCase
Experiment
EvalRun
SampleRun
Trace
Score
Evaluator
Baseline
Regression
ReleaseGate

不要让 Inspect 的内部类直接成为数据库 schema。

34.5 事件

EvalRunStarted
SampleStarted
ToolCalled
SampleFinished
ScoreProduced
EvalRunFinished
RegressionDetected
ReleaseGateFailed

34.6 数据层

建议:

Metadata → PostgreSQL
Trace    → Object Storage / ClickHouse-like analytics
Artifacts→ Object Storage
Aggregates→ PostgreSQL / OLAP

高基数 Trace 不要全部塞 CRD 或单一 JSONB 大字段。

34.7 验收问题


本章依据

  1. Inspect AI — Extensions
  2. Inspect AI — Hooks
  3. Inspect AI GitHub — UK AI Security Institute