微软开源 OpenForgeRL:实打环境训练复杂 AI 智能体
microsoft · hf · 2026-07-25
微软发布了开源框架 OpenForgeRL,旨在解决现代 AI 智能体(如依赖多轮推理和工具使用的 Claude Code、Codex 等)难以进行端到端训练的痛点。
核心机制
- 解耦训练与推理:通过轻量级代理记录真实 Harness 的模型调用作为训练数据,并利用 Kubernetes 在独立远程容器中执行 rollout。
- 兼容性:可与 veRL 等标准 RL 代码库无缝结合,支持在任何环境中扩展训练。
性能表现
- 工具型智能体:在数百到数千个任务的训练下,OpenForgeClaw 在 ClawEval 和 QwenClawBench 上分别达到 55.9 和 33.7 的成绩。
- GUI 智能体:OpenForgeGUI 在 OSWorld-Verified、Online-Mind2Web 等基准测试中超越了同等规模的基线模型,甚至匹敌数倍于其规模的模型。
关键发现
研究表明,不同的 Harness 对智能体的学习难度影响显著。强化学习(RL)能显著提升智能体的自我验证、工具覆盖和多步计划执行能力,但错误恢复等关键能力依然薄弱。
所属事件:微软开源OpenForgeRL实现端到端训练(4 条相关)→
「编程与Agent」频道最新
- 团队级 AI Agent 落地难题:共享上下文和任务协调放哪里? — Al_Grigor · 2026-09-11
- MCP 链式调用无回滚:agent 工程的真实痛点 — agentrsdg · 2026-09-11
- DeepMind 等论文:设计文档当真相源,代码改为可抛弃产物 — Roger_M_Taylor · 2026-09-11
- 用 Agent 造小分类器:19 万文档标注成本仅 0.7 美元 — vanstriendaniel · 2026-09-11
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11