多 harness RL 指南:LFM2.5 得分 42%→54%,工具调用少 31%

SergioPaniego · x · 2026-10-01

Adithya S K 发布《The ultimate guide to multi-harness RL》开源指南。核心观察:同一模型在不同 agent harness(Claude Code、Codex、OpenCode 等)中的表现差异很大。他们提出一套开放方法,让任意模型可在任意任务集上、直接在用户真实使用的 harness 内做 RL 训练,且无需改动 harness 或训练代码的一行。实测:LFM2.5-2.6B 在四个 harness 上跨 harness 训练后,得分从 42% 提升到 54%,工具调用次数减少 31%。

所属事件:多 harness RL 训练显效,LFM2.5 得分 42% 提至 54%(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →