SAO 优于 GRPO 变体

ziv_ravid · x · 2026-07-11

这段线程在讲一种新的 RL 训练思路,并给出实验结果:

这条更像是在分享一组关于 agent/RL 训练稳定性与价值模型作用的研究观察。

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →