多 harness RL 指南爆火:LFM2.5 从 42% 提到 54%,工具调用省 31%

SergioPaniego · x · 2026-10-10

adithyask 团队发布《The Ultimate Guide to Multi-Harness RL》,一周内获 5 万+阅读、Twitter 热榜三天、Hugging Face 热门第二。核心观察:同一个模型在不同 agent harness(如 Claude Code、Codex、OpenCode)中表现差异很大。他们提出一套开源训练方法,在不改 harness 或训练代码任何一行的情况下,让模型在人们实际使用的 harness 内针对任意任务集做 RL 训练。跨四个 harness 训练后,LFM2.5-2.6B 从 42% 提升到 54%,工具调用次数减少 31%。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →