微软 Agent Lightning 用 6K 数据将 SWE-bench 提升至 56.4%
omarsar0 · x · 2026-08-19
微软发布了 Agent Lightning v1.0,这是一个利用强化学习(RL)训练智能体代理的新框架。它通过端点代理将“harness”(拥有工具、上下文和控制流的环境)连接到 RL 训练循环,解决了 retokenization、样本合并、优势计算等工程问题。
实测表明,仅使用 6K 个训练样本和适度算力,该框架将 Qwen2.5-9B 模型在 SWE-bench Verified 上的得分从 41.8% 提升至 56.4%,验证了通过 RL 优化后训练流程的有效性。
所属事件:微软开源 Agent Lightning,大幅提升编码智能体性能(2 条相关)→
「编程与Agent」频道最新
- 巧用 Codex 与 NeMo-RL 在 Slurm 集群训练模型 — JFPuget · 2026-08-19
- 消费级 Agent 一个月内大跃迁,邮件日历界面将被颠覆 — omooretweets · 2026-08-19
- Stripe 接入 Grok Bot 实现客服退款自动化 — jeff_weinstein · 2026-08-19
- 多智能体协作:拆分任务比全能 Agent 更高效 — RonnySaya · 2026-08-19
- Agent 课程预告:如何评估 Agent 的能力(Evals) — ben_burtenshaw · 2026-08-19
- Claude Code 插件:用本地 LLM 将输出转写为平实英语 — tom_doerr · 2026-08-19