多 harness RL 训练显效,LFM2.5 得分 42% 提至 54%
Hugging Face 的 Lewis Tunstall 发布技术深潜指出,同一模型在不同 agent harness 中表现差异巨大:LFM2.5-2.6B 未训练时在 benchmark 上得分仅约 42%,不同 harness 间差距接近一倍。配合 Adithya S K 开源的《多 harness RL 终极指南》,通过在 harness 内进行强化学习训练,LFM2.5 得分提升至 54%,同时工具调用次数减少 31%,验证了多 harness RL 训练的有效性。
2026-10-01 ~ 2026-10-02 · 2 条相关
- 多 harness RL 指南:LFM2.5 得分 42%→54%,工具调用少 31% — SergioPaniego · 2026-10-01
- LFM2.5 在不同 harness 里成绩差近一倍,用 RL 在 harness 内训练拉到 54% — _lewtun · 2026-10-02