HuggingFace 用多 harness 强化学习解决模型换壳掉点问题

huggingface · x · 2026-10-05

HuggingFace 研究人员提出 multi-harness 强化学习,解决开放权重模型换个 agent harness 就掉点、产出无效工具调用的问题。

问题根源:在单一 harness 内训练会让模型记住该 harness 特定的工具名、输出格式、上下文结构和控制流——模型学到的是「怎么操作这个壳」,而不是怎么解决任务。

做法:训练时同时通过 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 四个 harness 进行 RL,为打通流程,他们把三个开源系统连接起来:OpenEnv 在 agent harness、RL 环境和 trainer 之间提供标准接口,其 capture proxy 位于中间捕获交互数据。

附带文章:作者还引用了自己此前写的《The Anatomy of an Agent Harness》,深入拆解 Anthropic、OpenAI、Perplexity 和 LangChain 的 harness 设计——编排循环、工具、记忆与上下文管理。

所属事件:HuggingFace 用多编码工具强化训练开放权重模型(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →