GLM 5.2 RL 的 SAO 细节

nrehiew_ · x · 2026-07-09

这条回复讨论了 GLM 5.2 RL 论文中的 SAO 方案,重点是为了解决长序列异步 RL 的 off-policy 偏差。

回复里提到的核心做法包括:直接用 rollout policy 做重要性采样、简化 trust region clipping、以及通过这些改动处理 off-policyness 带来的训练问题。

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →