微软开源 OpenForgeRL:实打环境训练复杂 AI 智能体
microsoft · hf · 2026-07-25
微软发布了开源框架 OpenForgeRL,旨在解决现代 AI 智能体(如依赖多轮推理和工具使用的 Claude Code、Codex 等)难以进行端到端训练的痛点。
核心机制
- 解耦训练与推理:通过轻量级代理记录真实 Harness 的模型调用作为训练数据,并利用 Kubernetes 在独立远程容器中执行 rollout。
- 兼容性:可与 veRL 等标准 RL 代码库无缝结合,支持在任何环境中扩展训练。
性能表现
- 工具型智能体:在数百到数千个任务的训练下,OpenForgeClaw 在 ClawEval 和 QwenClawBench 上分别达到 55.9 和 33.7 的成绩。
- GUI 智能体:OpenForgeGUI 在 OSWorld-Verified、Online-Mind2Web 等基准测试中超越了同等规模的基线模型,甚至匹敌数倍于其规模的模型。
关键发现
研究表明,不同的 Harness 对智能体的学习难度影响显著。强化学习(RL)能显著提升智能体的自我验证、工具覆盖和多步计划执行能力,但错误恢复等关键能力依然薄弱。
所属事件:微软开源OpenForgeRL实现端到端训练(4 条相关)→
「编程与Agent」频道最新
- 并行 scout agents 被认为能提升理解并降低延迟 — pvncher · 2026-07-26
- 有人只用 SQL 查询做出 3D《Doom》游戏 — thursdai_pod · 2026-07-26
- GDG Melbourne 分享 Google ADK 与 MCP 智能体应用 — kuanhoong · 2026-07-26
- AI 代码独立复审真能信吗,团队仍要人审和脚本兜底 — Few-Ad-1358 · 2026-07-26
- Google ADK 演讲展示托管 MCP 如何连接真实数据 — kuanhoong · 2026-07-26
- Google ADK 线下实战课教 55 人做 agent 评测和护栏 — kuanhoong · 2026-07-26