微软 OpenForgeRL:在真实部署 harness 中训练智能体
dair_ai · x · 2026-07-25
微软研究员及合作者提出 OpenForgeRL,目标是在智能体真实部署所处的 harness 里直接训练它们。
- 现有智能体通常运行在 Claude Code、Codex、OpenClaw 这类复杂 harness 中,但多数 RL 训练却在被简化过的环境里进行,和真实部署存在明显偏差。
- OpenForgeRL 用轻量代理来承接 harness 的模型调用,并把这些调用记录成训练数据接入标准 RL 框架;同时用 Kubernetes orchestrator 把每次 rollout 放进独立容器。
- 这样可以在真实 harness 中、以可扩展方式训练,降低“训练—部署不一致”。
- 论文给出的结果包括:WebVoyager 72.3、Online-Mind2Web 63.0、OSWorld-Verified 37.7,在同等规模开源基线中表现更强,部分任务甚至接近更大模型。
- 论文还指出,harness 本身就是重要训练变量:不同 harness 难度差异很大;RL 能提升自检和多步完成能力,但错误恢复仍然薄弱。
「编程与Agent」频道最新
- OpenRouter 推出分类器测试版,给模型路由打标签并可视化 — AccBalanced · 2026-07-25
- Codex 工作流技巧:先画流程,再让它实现 — alex_frantic · 2026-07-25
- 论文指出生产级 Agent 失效多因上下文失控 — omarsar0 · 2026-07-25
- Gemini CLI 修复 Windows diff 视图的 CRLF 行尾问题 — luisfelipe-alt · 2026-07-25
- VaynerX 用 Claude 在几小时内做出原本要价 2 万美元的内部应用 — tomcrawshaw01 · 2026-07-25
- Uber 详解多模态菜品 agent 的闭环评测 — AI Engineer · 2026-07-25