GLM 5.2 RL 论文笔记

nrehiew_ · x · 2026-07-09

这条帖子分享了对 GLM 5.2 强化学习论文的笔记,重点提到论文中公开的新算法 SAO。该算法主要针对长序列异步强化学习中的 off-policy 问题。

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →