Harness-R1:用 9B 小模型修复大智能体,在线强化学习的新玩法
rohanpaul_ai · x · 2026-08-05
最新论文《Harness-R1》提出了一种创新方法:使用一个经过专门训练的 9B 小模型,成功改进了参数量高达 397B 的目标智能体。
核心机制:
- Harness-R1 训练了一个独立的“工程师智能体”,专门负责重写和编辑目标智能体周围的执行层代码。
- 它从目标智能体失败的任务轨迹中提取数据,编写经验证的代码钩子,用于环境设置、决策前引导或反馈后恢复。
- 通过在线 GRPO(Group Relative Policy Optimization),仅根据任务奖励的实际变化来更新这个 9B 编辑器模型。
这种方法确保了庞大的目标模型在奖励信号下不发生漂移,而小模型则能学习到真正能改善执行的补丁,而非仅仅看起来合理的修改。
所属事件:Harness-R1让智能体从失败中自我修复(3 条相关)→
「编程与Agent」频道最新
- Grounded Document Agent:长 PDF 问答带页码引用,全本地跑通 — Roger_M_Taylor · 2026-09-22
- Synara v0.9.0 将 Computer Use 带入 macOS 原生应用 — CurieuxExplorer · 2026-09-22
- Jev 工程实测:毫秒级决策层让 300 Agent 集群快 193 倍省 444 倍 — Roger_M_Taylor · 2026-09-22
- scikit-learn 联创等将直播对谈:智能体数据科学哪些已落地 — hugobowne · 2026-09-22
- Pi 官方不做 Sub-agent,社区涌现 5 款 Agent Team 插件 — solyarisoftware · 2026-09-22
- Pi v0.87.0 发布:会话上下文可直接编辑,含 5 处破坏性变更 — solyarisoftware · 2026-09-22