微软提出 Harnessed Agentic RL,消除训练部署鸿沟

SergioPaniego · x · 2026-08-20

微软研究院发布了 Agent Lightning v1.0 框架及相关论文,提出“Harnessed Agentic RL”(受控智能体强化学习)范式。该方法主张直接在 Agent 部署时的真实 Harness(管理工具和上下文的框架)中进行强化学习训练,而非在重新模拟的环境中训练,从而缩小训练与实际使用之间的差距。论文详细阐述了这一新范式带来的挑战,包括重分词、样本合并、优势计算、损失归一化及后端调度等问题,并给出了相应的解决方案。

所属事件:微软 Agent Lightning v1.0 发布,SWE-bench 提至 56.4%(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →