让环境陪 Agent 一起进化:EnvHarness 在 SWE-bench 提升 7 分
青稞AI · wechat · 2026-08-22
Google 研究团队提出 EnvHarness(环境脚手架),核心想法是:与其只让 Agent 单向探索静态环境,不如给环境也装上可动态修改的「脚手架」,实现环境与智能体的协同进化。
框架包含三类组件:开局(Stage) 通过重置后的隐蔽预设动作改变初始状态;法则(Contract) 接管环境底层逻辑,可拦截重写动作空间、状态过渡和观察;串联(Chain) 将多个独立环境拼接或按中间结果动态分支,拉长任务视距。
另一个 Agent「环境搭建师 EnvRigger」负责自动搭建脚手架,走「观察 → 诊断 → 编写 → 验证」四步闭环:收集 Agent 轨迹、诊断能力短板(如钻漏洞、死循环),针对性编写脚手架组件,并实战验证新环境是否逼出新技能且仍有解,不合格则打回重写。
在 SWE-bench Verified 上,Agent 成功率随定制环境增加从 47.67% 升至 54.79%,且环境加到 300 个时性能曲线仍在上升;环境随轮次升级施压——先治调用错误,再模拟资源枯竭,最后封死捷径逼 Agent 深挖底层代码。论文还规划了扩展组件库、拓展至视觉/GUI/具身环境、语义化任务组合三个方向。
(论文:arxiv.org/abs/2608.19880,代码已开源)
所属事件:谷歌发布EnvHarness:让训练环境随智能体共同进化(5 条相关)→
「编程与Agent」频道最新
- Fable 5 对比 Ox Alpha:游戏 Demo 生成仍大幅领先 — ChrisGPT · 2026-08-22
- Agent 安全指南:最小权限原则防级联故障 — blaizedsouza · 2026-08-22
- OpenCode Senses:为本地模型加视觉层 — JeremyCMorgan · 2026-08-22
- FreeToken:消费级显卡流畅运行 290B+ MoE 模型 — SysPsych · 2026-08-22
- Coco:基于 Inkling 的本地语音助手,支持主动协作 — EchoShao8899 · 2026-08-22
- Claude 一次搞定伺服电机硬件配置 — _Stocko_ · 2026-08-22