Qwen 团队开源 QwenGyre:超长程 Agent 在线 RL 训练框架
Qwen · hf · 2026-09-29
Qwen 团队发布 QwenGyre,面向超长程(xlong-horizon)Agent 的端到端在线强化学习框架。单次执行可持续数小时、数百次模型-环境交互、每次 rollout 近 100 万 token,直接做在线 RL 有两大难题:执行方差大、rollout 延迟长导致 GPU 大量空转;复杂非线性分支产生海量冗余轨迹,拖垮训练效率。
QwenGyre 的解法:
- 弹性 GPU 重分配:在不中断在线执行的情况下,在 rollout 与训练之间动态调度 GPU。
- 轨迹处理器:重建分支历史、对部分进度打分、去重冗余路径,控制训练成本。
效果:将旗舰模型 Qwen3.8 2.4T 以每次 rollout 70 万 token 规模训练,48 步内在 NL2RepoBench 上取得 6.0% 绝对提升(52.5%→58.5%);相比 Colocate 和 Async 架构分别获得最高 1.85 倍和 1.78 倍加速。
「编程与Agent」频道最新
- 23 岁的 Reflexion 作者 Noah Shunn:从本科生到 agent 先锋 — vaibhavbetter · 2026-09-29
- Codex CLI 0.159.0 发布:新增即时打断与 Mermaid 渲染等改进 — github-actions[bot] · 2026-09-29
- 博主弃 Cursor+Grok,全天实测 Claude Code+Opus 5.5 — jonathan_wilke · 2026-09-29
- Vercel 迁移奔驰 F1 官网:构建快 70%、渲染快 75%,一周内完成 — shuding · 2026-09-29
- 从 Tab 补全到全程托管:AI 编程的进化梗图 — tlakomy · 2026-09-29
- IGSD 用环境验证的后见自蒸馏训练搜索智能体 — _reachsumit · 2026-09-29