微软提出 Harnessed Agentic RL,消除训练部署鸿沟
SergioPaniego · x · 2026-08-20
微软研究院发布了 Agent Lightning v1.0 框架及相关论文,提出“Harnessed Agentic RL”(受控智能体强化学习)范式。该方法主张直接在 Agent 部署时的真实 Harness(管理工具和上下文的框架)中进行强化学习训练,而非在重新模拟的环境中训练,从而缩小训练与实际使用之间的差距。论文详细阐述了这一新范式带来的挑战,包括重分词、样本合并、优势计算、损失归一化及后端调度等问题,并给出了相应的解决方案。
所属事件:微软 Agent Lightning v1.0 发布,SWE-bench 提至 56.4%(3 条相关)→
「编程与Agent」频道最新
- 可视化 Claude Code 一周工作流:按时间展开文件变更 — repligate · 2026-08-20
- 硬核玩法:利用 OAuth 让 Claude Code 调用 Grok 而无需 API Key — socialwithaayan · 2026-08-20
- 用 Grok Bot 做全天候求职代理:每天自动投 20 份定制简历 — bigaiguy · 2026-08-20
- 实测一个月打脸:Claude 自动 SEO 循环为什么全是坑 — ayushtweetshere · 2026-08-20
- AI Agent 直连 Gmail 与 Drive,Prompt 注入成最大软肋 — emmanuelvivier · 2026-08-20
- 时序知识图记忆引擎延迟降 90%,超越 MemGPT — anirbanbandyo · 2026-08-20