GLM团队提出SAO算法,突破智能体异步强化学习瓶颈
清华与Z.AI团队针对大模型智能体强化学习(RL)提出单次展开异步优化方法(SAO,Single-rollout Asynchronous Optimization)。该方法打破了传统群体采样需等待最慢轨迹的限制,允许模型在单条rollout完成后立即学习,有效解决了长序列异步训练中的off-policy偏差与稳定性问题。
核心机制与训练细节
SAO算法的核心在于将采样模式从群体采样改为单次展开。为了降低由此带来的方差,研究团队重新引入了价值模型。在处理智能体轨迹时,为避免优势函数穿过未生成的观察标记,模型将上一个动作的最后标记直接连接到下一个动作。在Critic训练方面,为解决梯度爆炸问题,团队冻结了注意力层,仅更新MoE projections。
离策略处理与性能表现
针对离策略偏差,算法直接使用展开策略进行重要性采样,并简化了信任域裁剪。具体而言,算法丢弃旧策略,采用当前策略与展开引擎的logprobs比值,并利用双侧硬边界直接在梯度中剔除越界样本。实验表明,在异步设置下GRPO退化严重,而SAO表现更稳。在SWE-Bench Verified等编码与推理基准上,SAO优于现有方法;在偏好剧变的在线实验中,SAO配合GLM 4.7 judge展现出了更快的适应速度。
2026-07-09 ~ 2026-07-11 · 15 条相关
一手来源
- 单次展开异步优化提升智能体强化学习 — zai-org ·
- GLM 5.2 RL 论文笔记 — nrehiew_ ·
- 清华/Z.AI发智能体异步RL论文 — ziv_ravid ·
- 单次Rollout异步优化方法 — the-aiml · 2026-07-09
- 【源头】单次展开异步优化提升智能体强化学习 — zai-org · 2026-07-09
- 【源头】GLM 5.2 RL 论文笔记 — nrehiew_ · 2026-07-09
- 解析GLM算法off-policy处理 — nrehiew_ · 2026-07-09
- 长序列 RL 训练细节整理 — nrehiew_ · 2026-07-09
- SAO在线实验适应更快 — nrehiew_ · 2026-07-09
- GLM 5.2 RL 的 SAO 细节 — nrehiew_ · 2026-07-09
- 单条Rollout异步训练Agent — burny_tech · 2026-07-10
- 【源头】清华/Z.AI发智能体异步RL论文 — ziv_ravid · 2026-07-11
- 异步强化学习不适合GRPO — ziv_ravid · 2026-07-11
- Critic 训练细节与稳定性 — ziv_ravid · 2026-07-11
- Agent 轨迹的 GAE 处理 — ziv_ravid · 2026-07-11
- 离策略训练的硬边界处理 — ziv_ravid · 2026-07-11
- SAO 优于 GRPO 变体 — ziv_ravid · 2026-07-11
- 研究证实异步与群体采样存在失配 — ziv_ravid · 2026-07-11