4B 模型靠在线合成课程达 61.5% SWE-bench,不需蒸馏前沿模型
rohanpaul_ai · x · 2026-09-21
FrogNano 项目从 Qwen3.5-4B 出发,通过强化学习在约 1500 个合成软件工程任务上训练出一个 4B 编码 agent,在 SWE-bench Verified 上达到 61.5%,且未经前沿模型蒸馏。关键在于两点:
- 在线任务合成课程:随模型能力提升,系统持续生成「有挑战但仍可学」的新问题,课程随 agent 一起进化。
- 工具接口简化:仅将工具设置换成更简单的 5 工具方案,基础模型成绩即从 8.3% 跃升至 37.2%;经 5 轮训练后达 61.5%。
论文:arxiv.org/abs/2609.07925
「编程与Agent」频道最新
- 70 个网络安全实战项目开源,附完整源码 — tom_doerr · 2026-09-21
- 实测对比游戏开发:V4.1 干翻 Astra 默认品味 — teortaxesTex · 2026-09-21
- 「只需 3 行代码」或是败笔:开发者想看清复杂度 — willcb · 2026-09-21
- TypeSafe 发布决策模型 Jev:不生成文本,直接输出带概率的类型化判断 — prakersh · 2026-09-21
- Jev Engineering:给 Agent 加决策大脑,测试提速193倍降本444倍 — agihouse_org · 2026-09-21
- 「像 jev 但本地开源」是错位定位?开发者热议 PAW 应学 DSPy 叙事 — willcb · 2026-09-21