SAO在线实验适应更快

nrehiew_ · x · 2026-07-09

帖子讨论了在完全在线设置下的实验结果,提到当用户偏好发生剧烈变化时,SAO 在写作任务中配合 GLM 4.7 judge 的适应速度更快。

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →