腾讯论文:任务持续加难优于协同进化,Terminal-Bench 提升 8.6 个百分点
rohanpaul_ai · x · 2026-09-09
腾讯新论文提出:随着 agent 能力提升,训练环境也必须持续变难,这比「任务与模型协同进化」效果更好。
- 核心洞察:合成终端任务会逐渐变得太简单,agent 可靠解出后 RL 信号就枯竭。
- 做法:不基于失败案例造任务,而是主动演进任务本身——降低熟悉度、加入更稀有技能、增加步数,每个更难版本经校验后再引入。
- 结果:在 Terminal-Bench 2.1 上,Qwen3.6-27B 达 71.5%(协同进化为 62.9%),Qwen3.6-35B-A3B 达 64.9%(55.1%),测试用了 Hy4 preview、Claude Opus 5、GPT-5.6 Sol。
所属事件:腾讯新论文:环境持续进化助力终端 Agent 大幅提升(2 条相关)→
「编程与Agent」频道最新
- 别乱用多 Agent 架构:主 Agent 反复调子 Agent 只会烧 token — keyanzhang · 2026-09-09
- Bindu Reddy 预告周四发布:主打长时 Agent 循环的超低价新 LLM — bindureddy · 2026-09-09
- 开源 huashu-chrome:让 Agent 带登录态操控你的 Chrome — AlchainHust · 2026-09-09
- 作者实测:GPT-6 Astra 秒完 Claude Code 搞不定的浏览器 Agent 任务 — AlchainHust · 2026-09-09
- Agent 二十次才翻车一次,你怎么证明修复有效? — Such-Process5697 · 2026-09-09
- Impeccable 用 Rust 重写引擎,设计检查钩子提速至约 10ms — mariorod1 · 2026-09-09