清华/Z.AI发智能体异步RL论文

ziv_ravid · x · 2026-07-11

读了一篇清华 / Z.AI 关于面向智能体的异步强化学习新论文(arXiv:2607.07508)。发帖人还提到,这篇论文发布在 GLM-5.2 之后,而 GLM-5.2 的说明里曾提到他们使用的是 critic,而不是 GRPO。

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →