评测即回放:用 R2+Docker 沙盒搭 agent eval,90% 功夫在测量
danshipper · x · 2026-10-11
Hammer(经 danshipper 转发)分享一套不踩坑的 agent eval 构建思路:
- 核心理念:eval 就是把过去做过的任务存下来,在新模型/新 prompt/新 skill 上重放,看是否改进。价值有三:定位失败点(向老板/用户交代)、持续优化、迁移到更便宜或开源模型上验证。
- 成本判断:「测量是否改进」占 90% 的工作量,基础设施只占 10%。
- 最小基建:让 agent 把任务存到 Cloudflare R2(便宜甚至免费),使用 Harbor 任务格式——保存任务指令 + 任务开始前的文件夹状态(确保 agent 拿到的文件和你当时一致)。
- 执行隔离:运行时 agent 拉取文件,在 Docker 容器(沙盒)中执行,防止 agent 偷看答案。
「编程与Agent」频道最新
- 微软推出 MXC 执行容器,为 AI Agent 提供跨平台沙箱隔离 — TheKanter · 2026-10-11
- wesbos 开源教程:root 锁死的安卓相框,还让 agent 帮忙 dump 固件 — natesiggard · 2026-10-11
- 播客详解 4 步 Agentic 工程工作流:隔离、构建、验证、发布 — petergyang · 2026-10-11
- Micky 分享 4 步 Agentic 工程工作流,让 AI 写出可上生产环境的代码 — petergyang · 2026-10-11
- Goodfire 推出模型内部监视器,以极低成本揪出失控 AI Agent — emmanuelvivier · 2026-10-11
- Hugging Face 把 OpenAI 数学题做成开源 RL 环境,Lean4 沙箱自动判分 — _lewtun · 2026-10-11