腾讯论文:环境持续进化让终端Agent成绩提升18个百分点

rohanpaul_ai · x · 2026-09-09

腾讯新论文《Environment Evolution for Terminal Agents》指出:随着前沿模型变强,静态合成任务会变得太简单,不再提供有效的 RL 信号;依赖在线 rollout 的共进化方法也会随模型增强而失效。

论文提出「环境进化」:以离线方式逐代递增环境难度,在训练中按代调度,持续供给学习信号。作者从多轮学习目标推导出三个影响难度的进化方向,并用多智能体工作流实现进化。实验显示进化后的环境在 Hy4 preview、Claude Opus 5、GPT-5.6 Sol 上一致更难;在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 上做简单长程 RL 训练后,Terminal-Bench 2.1 成绩分别提升 14.4 和 18.0 个百分点。

所属事件:腾讯新论文:环境持续进化助力终端 Agent 大幅提升(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →