同一模型不同 harness 分差 29%,HF 发布多 harness RL 全开源指南
huggingface · x · 2026-10-02
Hugging Face 团队发现:同一模型、同一权重,在一个 agent harness 中得分 62%,在另一个只有 33%。他们发布了年度最实用的多 harness RL 指南,完全开源。
核心技巧:不动 harness 本身,把模型指向一个代理(proxy)。代理支持编码 agent 用的全部四种 API 格式(OpenAI Chat Completions、OpenAI Responses、Anthropic Messages、Gemini),记录 vLLM 采样出的精确 token id 和 logprobs,并在其上训练。Claude Code、Codex、OpenCode 一行代码都不用改。
结果:
- 同时在 4 个 harness 上训练,Liquid AI 的 LFM2.5-2.6B 从 42% 提升到 54%
- 因给「更少步数完成任务」小奖励,工具调用减少 31%
- 只在 OpenCode 上训练把其成绩从 34% 提到 58%,但多 harness 训练的模型提升更均衡
所属事件:HF 发布多 harness 强化学习开源指南(5 条相关)→
「编程与Agent」频道最新
- 开发者:不敢让 AI Agent 直连个人邮箱,需审批门禁 — tomchapin · 2026-10-03
- 用 Claude 搭线下房产抢单流水线,卡在数据补全与外联安全 — italimade · 2026-10-03
- OpenClaw 发布 v2026.9.8:支持 GPT-6.1 Sol,43 个 PR 修复内存与启动问题 — heyneighbor · 2026-10-03
- 开发者感慨:用 AI 做提效元工具,从 bash 脚本变成完整应用 — devenbhooshan · 2026-10-03
- 开源 AI 科研助手 K-Dense BYOK 发布论文:本地运行+防篡改实验记录 — RexDouglass · 2026-10-03
- 谷歌论文:验证者干净上下文跑证明,探索者可放手试错 — solyarisoftware · 2026-10-03