同一模型不同 harness 分差 29%,HF 发布多 harness RL 全开源指南

huggingface · x · 2026-10-02

Hugging Face 团队发现:同一模型、同一权重,在一个 agent harness 中得分 62%,在另一个只有 33%。他们发布了年度最实用的多 harness RL 指南,完全开源。

核心技巧:不动 harness 本身,把模型指向一个代理(proxy)。代理支持编码 agent 用的全部四种 API 格式(OpenAI Chat Completions、OpenAI Responses、Anthropic Messages、Gemini),记录 vLLM 采样出的精确 token id 和 logprobs,并在其上训练。Claude Code、Codex、OpenCode 一行代码都不用改。

结果:

所属事件:HF 发布多 harness 强化学习开源指南(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →