智谱 SAO 论文:单采样异步 RL 稳定训练千步,超越 GRPO
teortaxesTex · x · 2026-08-21
智谱团队发布论文 SAO(Single-Rollout Asynchronous Optimization),针对异步 RL 在 agentic 任务中的 off-policy 与稳定性难题提出方案:
- 用单 rollout 采样取代 GRPO 式的组采样(每个 prompt 只采一条)
- 配合实用的 value model 训练设计
- 引入严格的双侧 token 级裁剪策略提升优化稳定性
实验上 SAO 可稳定训练 1000 步,在 SWE-Bench Verified、BeyondAIME、IMOAnswerBench 等 agentic 编码与推理基准上持续优于 GRPO 及其变体,并已部署于 GLM-5.2 的 agentic RL 后训练管线。
「模型」频道最新
- Reddit 讨论:递归元提示让 Qwen 按任务分层思考,省一半推理 token — Rare_Potential_1323 · 2026-08-21
- NVIDIA 公布 Qwen3.8-2.4T 模型部署方案:GB300 显卡吞吐超 4000 tokens/s — PyTorch · 2026-08-21
- 实战教程:通过继续预训练让本地 LLM 学习新领域 — funJS · 2026-08-21
- Qwen 3.8 27B两次对话就写出可玩3D游乐园,量化版也能打 — RandumbRedditor1000 · 2026-08-21
- Gemini 安全审查过严?连亲吻和公路拍照都拒 — Dry-Sympathy-3182 · 2026-08-21
- 0.63M 参数验证器媲美 7B 模型,AI 推理新极限 — jm_alexia · 2026-08-21