解析GLM算法off-policy处理

nrehiew_ · x · 2026-07-09

为了解决该问题,算法直接使用展开策略进行重要性采样,并简化了信任域裁剪。

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →