腾讯论文:环境持续进化让终端Agent成绩提升18个百分点
rohanpaul_ai · x · 2026-09-09
腾讯新论文《Environment Evolution for Terminal Agents》指出:随着前沿模型变强,静态合成任务会变得太简单,不再提供有效的 RL 信号;依赖在线 rollout 的共进化方法也会随模型增强而失效。
论文提出「环境进化」:以离线方式逐代递增环境难度,在训练中按代调度,持续供给学习信号。作者从多轮学习目标推导出三个影响难度的进化方向,并用多智能体工作流实现进化。实验显示进化后的环境在 Hy4 preview、Claude Opus 5、GPT-5.6 Sol 上一致更难;在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 上做简单长程 RL 训练后,Terminal-Bench 2.1 成绩分别提升 14.4 和 18.0 个百分点。
所属事件:腾讯新论文:环境持续进化助力终端 Agent 大幅提升(2 条相关)→
「编程与Agent」频道最新
- 别乱用多 Agent 架构:主 Agent 反复调子 Agent 只会烧 token — keyanzhang · 2026-09-09
- opencode 发布 v1.18.30:新增 GPT-6 Astra 系统提示词支持 — opencode-agent[bot] · 2026-09-09
- Bindu Reddy 预告周四发布:主打长时 Agent 循环的超低价新 LLM — bindureddy · 2026-09-09
- 开源 huashu-chrome:让 Agent 带登录态操控你的 Chrome — AlchainHust · 2026-09-09
- 作者实测:GPT-6 Astra 秒完 Claude Code 搞不定的浏览器 Agent 任务 — AlchainHust · 2026-09-09
- Agent 二十次才翻车一次,你怎么证明修复有效? — Such-Process5697 · 2026-09-09