面向Agent的异步单Rollout RL
de4dee · reddit · 2026-07-14
论文提出 Single-Rollout Asynchronous Optimization (SAO),目标是解决面向长链路 agent 任务时,异步 RL 的稳定性和离策略问题。
主要做法
- 用单条 rollout 取代 GRPO 常见的组内采样,降低异步训练中的离策略偏差
- 增加更实用的 value model 训练设计
- 引入严格的双边 token 级 clipping,提高优化稳定性
结果
- 训练可稳定跑到一千步,并在 SWE-Bench Verified、BeyondAIME、IMOAnswerBench 等基准上持续优于 GRPO 及其变体
- 在模拟在线学习场景中也表现更好,说明它对变化环境有适应能力
- 这套方法已被用于开源 GLM-5.2 的 agentic RL 训练管线中
所属事件:SAO异步强化学习算法在编程推理上超越GRPO(3 条相关)→
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11