OpenForge RL 让 harness 型 AI agent 支持端到端训练
burkov · x · 2026-07-26
现代 AI agent 越来越依赖像 Claude Code、Codex 这类复杂的推理 harness,来支撑多轮推理、工具调用和外部系统访问。
作者指出,这类有状态、多进程的 harness 很难用现有开源 SFT/RL 训练栈端到端训练,因为这些框架无法自然表达这种推理执行方式。为此,来自 Columbia 和 Microsoft Research 的作者提出了 OpenForge RL:一个面向多样环境、可端到端训练 harness-based agents 的开源框架。
所属事件:微软开源OpenForgeRL实现端到端训练(4 条相关)→
「编程与Agent」频道最新
- Qwen3.6-27B 16 位量化在复杂 C++ 代码上更稳 — TinyFrodo · 2026-07-26
- 做 AI 的人说,自己像在同一条时间线上活着两种人生 — RileyRalmuto · 2026-07-26
- LLM NPC 和涌现玩法,被说成像 AGI 的 Beta 版 — MickeySteamboat · 2026-07-26
- Gemini CLI 夜版更新:会话轮换、强制 HTTPS 等修复上线 — gemini-cli-robot · 2026-07-26
- “给 Agent 用的 Coinbase”主打实时交易与护栏执行 — kleffew94 · 2026-07-26
- 用 20 个子代理写 release notes,每个再派 50 个 — steipete · 2026-07-26