微软 OpenForgeRL:在真实部署 harness 中训练智能体
dair_ai · x · 2026-07-25
微软研究员及合作者提出 OpenForgeRL,目标是在智能体真实部署所处的 harness 里直接训练它们。
- 现有智能体通常运行在 Claude Code、Codex、OpenClaw 这类复杂 harness 中,但多数 RL 训练却在被简化过的环境里进行,和真实部署存在明显偏差。
- OpenForgeRL 用轻量代理来承接 harness 的模型调用,并把这些调用记录成训练数据接入标准 RL 框架;同时用 Kubernetes orchestrator 把每次 rollout 放进独立容器。
- 这样可以在真实 harness 中、以可扩展方式训练,降低“训练—部署不一致”。
- 论文给出的结果包括:WebVoyager 72.3、Online-Mind2Web 63.0、OSWorld-Verified 37.7,在同等规模开源基线中表现更强,部分任务甚至接近更大模型。
- 论文还指出,harness 本身就是重要训练变量:不同 harness 难度差异很大;RL 能提升自检和多步完成能力,但错误恢复仍然薄弱。
所属事件:微软开源OpenForgeRL实现端到端训练(4 条相关)→
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11