LFM2.5 在不同 harness 里成绩差近一倍,用 RL 在 harness 内训练拉到 54%

_lewtun · x · 2026-10-02

Hugging Face 的 Lewis Tunstall 发布技术深潜:同一模型在不同 agent harness 中表现差异巨大——LFM2.5-2.6B 未训练时在 Mini-SWE-Agent 解决 62% 任务,在 Claude Code 仅 33%。

核心难点与解法:harness 控制 agent loop,训练器拿不到模型实际产出的 token。团队方案:

结果:跨 4 个 harness 训练 LFM2.5-2.6B 后,held-out 任务成绩从 42% 提升到 54%,每个 harness 都有提升,且完成任务所需工具调用减少 31%。

所属事件:多 harness RL 训练显效,LFM2.5 得分 42% 提至 54%(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →