Marathoner:9B模型可连续编码10小时+、千次工具调用,SWE-bench达77.5%
mark_k · x · 2026-10-01
Marathoner:训练小模型的长时间持续编码能力
- 蚂蚁集团、北京大学与澳门大学的研究者发布 Marathoner,基于 Qwen3.5-9B,声称可连续编码 10 小时以上、完成 1000+ 次工具调用。
- 训练方法:从 1 万个仓库的 10 万条 GitHub PR 中挖掘软件任务;链式串联任务提高难度;用 Kimi K3 的成功运行做训练数据;在真实执行环境中做强化学习;一个巧妙设计是专门奖励运行后期的有效进展(如发现隐藏 bug、重大优化)。
- 成绩:SWE-bench Verified 从 43.8% 升至 77.5%,Terminal-Bench 2.0 从 27.3% 升至 57.2%。虽仍落后最强前沿模型,但对同一 9B 起点是巨大提升。
- 作者认为这是 AI 编码最重要的方向之一:能在你睡觉时持续推进的 agent 改变了可委托范围,而这种持久性可以被训练进小模型。
所属事件:蚂蚁集团发布超长程智能体 Marathoner:连续编码 10 小时(2 条相关)→
「编程与Agent」频道最新
- 睡前给 agent 布置任务,一觉醒来完成 6.5 小时的工作量 — therealdanvega · 2026-10-01
- 前 OpenAI 研究员推出 System One 模型 Jev,结构化决策快百倍 — KhuyenTran16 · 2026-10-01
- Jev 与 PydanticAI 的关键区别:在模型回答前就锁定决策 — KhuyenTran16 · 2026-10-01
- 博主开发海外播客转写 MCP,把播客变成高质量信息源 — vista8 · 2026-10-01
- Corbenic AI 推出 Galahad:KV 缓存落盘持久化,跨请求与重启复用 — MindPsychological140 · 2026-10-01
- Abridge 把临床医生反馈变成可量化评测体系,加速 agent 迭代 — LangChain · 2026-10-01