异步强化学习不适合GRPO

ziv_ravid · x · 2026-07-11

这条帖子转述了一篇来自清华/Z.AI 的新论文,主题是面向 agent 的异步强化学习。

核心观点是:

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →