腾讯新论文:环境持续进化助力终端 Agent 大幅提升

腾讯发布新论文《Environment Evolution for Terminal Agents》,指出随着前沿模型能力增强,静态合成终端任务会变得过于简单,无法再提供有效的 RL 训练信号。研究提出让训练环境随 agent 能力提升而持续变难的思路,实验显示这比「任务与模型协同进化」效果更好,可使 Terminal-Bench 成绩提升 8.6 至 18 个百分点。

2026-09-09 ~ 2026-09-09 · 2 条相关

另有 1 条近重复转述:rohanpaul_ai