Qwen 团队开源 QwenGyre:超长程 Agent 在线 RL 训练框架

Qwen · hf · 2026-09-29

Qwen 团队发布 QwenGyre,面向超长程(xlong-horizon)Agent 的端到端在线强化学习框架。单次执行可持续数小时、数百次模型-环境交互、每次 rollout 近 100 万 token,直接做在线 RL 有两大难题:执行方差大、rollout 延迟长导致 GPU 大量空转;复杂非线性分支产生海量冗余轨迹,拖垮训练效率。

QwenGyre 的解法:

效果:将旗舰模型 Qwen3.8 2.4T 以每次 rollout 70 万 token 规模训练,48 步内在 NL2RepoBench 上取得 6.0% 绝对提升(52.5%→58.5%);相比 Colocate 和 Async 架构分别获得最高 1.85 倍和 1.78 倍加速。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →