多 harness RL 训练显效,LFM2.5 得分 42% 提至 54%

Hugging Face 的 Lewis Tunstall 发布技术深潜指出,同一模型在不同 agent harness 中表现差异巨大:LFM2.5-2.6B 未训练时在 benchmark 上得分仅约 42%,不同 harness 间差距接近一倍。配合 Adithya S K 开源的《多 harness RL 终极指南》,通过在 harness 内进行强化学习训练,LFM2.5 得分提升至 54%,同时工具调用次数减少 31%,验证了多 harness RL 训练的有效性。

2026-10-01 ~ 2026-10-02 · 2 条相关