多 harness RL 指南:LFM2.5 得分 42%→54%,工具调用少 31%
SergioPaniego · x · 2026-10-01
Adithya S K 发布《The ultimate guide to multi-harness RL》开源指南。核心观察:同一模型在不同 agent harness(Claude Code、Codex、OpenCode 等)中的表现差异很大。他们提出一套开放方法,让任意模型可在任意任务集上、直接在用户真实使用的 harness 内做 RL 训练,且无需改动 harness 或训练代码的一行。实测:LFM2.5-2.6B 在四个 harness 上跨 harness 训练后,得分从 42% 提升到 54%,工具调用次数减少 31%。
所属事件:多 harness RL 训练显效,LFM2.5 得分 42% 提至 54%(2 条相关)→
「编程与Agent」频道最新
- 开发者实测 OpenAI dots:速度快、首次执行成功率高 — billyjhowell · 2026-10-02
- MINTEval 入选 NeurIPS:LLM agent 难跟上持续变化的环境 — EliasEskin · 2026-10-02
- Claude Code 官员回应状态点「摆态度」:它可能只是忙着别的事 — cyrus_zei · 2026-10-02
- LlamaIndex 发布 Extract v2.5,文档抽取性价比超 Claude 与 GPT — llama_index · 2026-10-02
- 用 MiniMax M3 挖出 Ghost 首个 CVE:CVSS 8.8 内存破坏漏洞 — DanielLockyer · 2026-10-02
- Keyfleet 预告:个人 Agent 加入自动协作「舰队」并共享收益 — seanwbren · 2026-10-02