微软 OpenForgeRL 让代理在任意环境端到端训练
Fighterdan · hf · 2026-07-25
微软研究团队提出 OpenForgeRL:一个开源框架,用于在任意环境里端到端训练 harness-native agents。
它解决什么问题
现代 AI agent 往往依赖 Claude Code、Codex、OpenClaw 这类复杂 inference harness 来完成多轮推理、工具调用和外部系统访问;但开放训练栈很难原生表达这种多进程、有状态的推理过程。OpenForgeRL 用两部分解决:
- 一个轻量级 proxy:拦截 harness 的模型调用,并把它们记录成训练数据,供标准 RL 栈(例如 veRL)使用。
- 一个 Kubernetes orchestrator:让每次 rollout 都在独立远程容器中运行,便于规模化训练。
论文里的结果
- OpenForgeClaw:在 ClawEval 上达到 31.7 pass^3 和 55.9 pass@3,在 QwenClawBench 上达到 33.7。
- OpenForgeGUI:在 OSWorld-Verified 上 37.7,Online-Mind2Web 上 63.0,WebVoyager 上 72.3。
- 作者称,这些结果在多数基准上优于同尺寸开源基线,GUI 场景里甚至能接近或超过大得多的模型。
额外发现
- 不同 harness 的学习难度差异很大。
- RL 会提升 agent 的可靠性、自检能力、工具覆盖率和多步计划完成率。
- 但错误恢复仍然是明显短板。
所属事件:微软开源OpenForgeRL实现端到端训练(4 条相关)→
「编程与Agent」频道最新
- alphaXiv 开源 OpenResearch:用任意模型并行跑研究智能体 — alphaXiv · 2026-09-11
- MathModelAgent 走红:自动完成数学建模并生成可提交论文 — jihe520 · 2026-09-11
- 开源 AI 销售 OS DeskcommCRM 爆火:自带 Agent 与 WhatsApp 集成 — melgarafael · 2026-09-11
- hyperresearch 开源:让 Agent 把网络调研沉淀为可搜索知识库 — jordan-gibbs · 2026-09-11
- Forter 两周全员 Agent 冲刺 13 条经验:跳过自建 RAG 靠企业搜索 — bibryam · 2026-09-11
- 拆解两款真实「公司大脑」:Slite 与 Gorgias 同台对比构建之道 — femke_plantinga · 2026-09-11