LFM2.5 在不同 harness 里成绩差近一倍,用 RL 在 harness 内训练拉到 54%
_lewtun · x · 2026-10-02
Hugging Face 的 Lewis Tunstall 发布技术深潜:同一模型在不同 agent harness 中表现差异巨大——LFM2.5-2.6B 未训练时在 Mini-SWE-Agent 解决 62% 任务,在 Claude Code 仅 33%。
核心难点与解法:harness 控制 agent loop,训练器拿不到模型实际产出的 token。团队方案:
- 用 OpenEnv 中的 capture proxy 记录 harness 里的 token + logprobs
- 用 Harbor 框架提供任务与沙箱
- 用 TRL 的异步 GRPO trainer 快速训练
结果:跨 4 个 harness 训练 LFM2.5-2.6B 后,held-out 任务成绩从 42% 提升到 54%,每个 harness 都有提升,且完成任务所需工具调用减少 31%。
所属事件:多 harness RL 训练显效,LFM2.5 得分 42% 提至 54%(2 条相关)→
「编程与Agent」频道最新
- n8n 上线 typesafeai 的 Jev 模型,专做模糊条件路由判断 — hardimanjames · 2026-10-02
- Firecrawl 推出 People Enrichment Pack,让 Agent 查人查公司 — devdigest · 2026-10-02
- 斯坦福新开 CS 224V 课程:用 RAG 与形式化方法做可靠 Agent — stanfordnlp · 2026-10-02
- 开发者实测 OpenAI dots:速度快、首次执行成功率高 — billyjhowell · 2026-10-02
- MINTEval 入选 NeurIPS:LLM agent 难跟上持续变化的环境 — EliasEskin · 2026-10-02
- Claude Code 官员回应状态点「摆态度」:它可能只是忙着别的事 — cyrus_zei · 2026-10-02