单次展开异步优化提升智能体强化学习

zai-org · hf · 2026-07-09

提出一种用于智能体强化学习的单次展开异步优化方法。该方法解决了LLM在复杂任务训练中的稳定性问题,在编程和推理基准测试中优于现有方法。

所属事件:GLM团队提出SAO算法,突破智能体异步强化学习瓶颈(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →