多 harness RL 指南爆火:LFM2.5 从 42% 提到 54%,工具调用省 31%
SergioPaniego · x · 2026-10-10
adithyask 团队发布《The Ultimate Guide to Multi-Harness RL》,一周内获 5 万+阅读、Twitter 热榜三天、Hugging Face 热门第二。核心观察:同一个模型在不同 agent harness(如 Claude Code、Codex、OpenCode)中表现差异很大。他们提出一套开源训练方法,在不改 harness 或训练代码任何一行的情况下,让模型在人们实际使用的 harness 内针对任意任务集做 RL 训练。跨四个 harness 训练后,LFM2.5-2.6B 从 42% 提升到 54%,工具调用次数减少 31%。
「编程与Agent」频道最新
- Google 面试改革:新增 Code Comprehension 轮,用 Gemini 考你能否识破 AI — burny_tech · 2026-10-10
- 月账单 1.14 万美元查不清去向:一个团队的 LLM 成本失控复盘 — vigilAPI · 2026-10-10
- 实测豆包工作画布:一张形象图长出 VI 手册、电商页与整套 Deck — xiaohu · 2026-10-10
- 用 Codex 迁移 5.5TB 图片视频到 AWS,开发者感叹不再亲自动手 — CtrlAltDwayne · 2026-10-10
- Hermes Kanban 上线:用看板管理多 Agent 任务与交接 — Teknium · 2026-10-10
- Agent 时代 Jupyter Notebook 过时了吗?数据科学家反思 cell 工作流 — Economy_Vacation_504 · 2026-10-10