智谱 SAO 论文:单采样异步 RL 稳定训练千步,超越 GRPO

teortaxesTex · x · 2026-08-21

智谱团队发布论文 SAO(Single-Rollout Asynchronous Optimization),针对异步 RL 在 agentic 任务中的 off-policy 与稳定性难题提出方案:

实验上 SAO 可稳定训练 1000 步,在 SWE-Bench Verified、BeyondAIME、IMOAnswerBench 等 agentic 编码与推理基准上持续优于 GRPO 及其变体,并已部署于 GLM-5.2 的 agentic RL 后训练管线。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →