GLM团队提出SAO算法,突破智能体异步强化学习瓶颈

清华与Z.AI团队针对大模型智能体强化学习(RL)提出单次展开异步优化方法(SAO,Single-rollout Asynchronous Optimization)。该方法打破了传统群体采样需等待最慢轨迹的限制,允许模型在单条rollout完成后立即学习,有效解决了长序列异步训练中的off-policy偏差与稳定性问题。

核心机制与训练细节

SAO算法的核心在于将采样模式从群体采样改为单次展开。为了降低由此带来的方差,研究团队重新引入了价值模型。在处理智能体轨迹时,为避免优势函数穿过未生成的观察标记,模型将上一个动作的最后标记直接连接到下一个动作。在Critic训练方面,为解决梯度爆炸问题,团队冻结了注意力层,仅更新MoE projections。

离策略处理与性能表现

针对离策略偏差,算法直接使用展开策略进行重要性采样,并简化了信任域裁剪。具体而言,算法丢弃旧策略,采用当前策略与展开引擎的logprobs比值,并利用双侧硬边界直接在梯度中剔除越界样本。实验表明,在异步设置下GRPO退化严重,而SAO表现更稳。在SWE-Bench Verified等编码与推理基准上,SAO优于现有方法;在偏好剧变的在线实验中,SAO配合GLM 4.7 judge展现出了更快的适应速度。

2026-07-09 ~ 2026-07-11 · 15 条相关

一手来源