HuggingFace 用多 harness 强化学习解决模型换壳掉点问题
huggingface · x · 2026-10-05
HuggingFace 研究人员提出 multi-harness 强化学习,解决开放权重模型换个 agent harness 就掉点、产出无效工具调用的问题。
问题根源:在单一 harness 内训练会让模型记住该 harness 特定的工具名、输出格式、上下文结构和控制流——模型学到的是「怎么操作这个壳」,而不是怎么解决任务。
做法:训练时同时通过 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 四个 harness 进行 RL,为打通流程,他们把三个开源系统连接起来:OpenEnv 在 agent harness、RL 环境和 trainer 之间提供标准接口,其 capture proxy 位于中间捕获交互数据。
附带文章:作者还引用了自己此前写的《The Anatomy of an Agent Harness》,深入拆解 Anthropic、OpenAI、Perplexity 和 LangChain 的 harness 设计——编排循环、工具、记忆与上下文管理。
所属事件:HuggingFace 用多编码工具强化训练开放权重模型(2 条相关)→
「编程与Agent」频道最新
- 开发者用 Astra 多轮打磨卡片动画,效果令人满意 — Dimillian · 2026-10-06
- pg-jev 开源扩展:让 Postgres 直接用 SQL 跑语义过滤与打分 — Arindam_1729 · 2026-10-06
- 开源 Discord AI 助手 Zauq v4 发布:有界 agent 运行时+MCP+沙箱验证 — rar_file-exe · 2026-10-06
- Orbio 上线 Agent 新工具:沙盒跑码、常驻服务器、专属邮箱与数据库 — econoar · 2026-10-06
- OSWorld 榜首易主:单任务成本 14.34 美元,比 Claude 便宜四成 — xwang_lk · 2026-10-06
- 用 AI 破局求职:技能+曝光两维度实操路线图 — brandon_galang · 2026-10-06