MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis
Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan
cs.SE, cs.CL, cs.LG
2026-07-30
把开源 CLI 脱源码做成「从零写完整程序」的训练环境,用 GLM-5.2 当老师生成轨迹微调 Qwen3.6-27B,ProgramBench 通过率从 37.98% 升到 49.51%,反超 Sonnet 4.6,还泛化到 7 个没见过的软件工程基准。
现在的 coding agent 在「改别人的代码」上进步很大,修 bug、加功能都有现成仓库可读。但「从零写一整个程序」是另一回事:没有现成实现可以扩展,agent 得自己从文档和参考程序的行为里推断完整规格、设计架构、实现、定位自己的 bug、写测试、反复打磨。ProgramBench 专门考这件事,结果连 GPT-5.5 这样的前沿模型完整通过的题也不到 1%。
卡点不在模型本身,而在缺训练数据。现有造环境的框架只覆盖软件开发的一个阶段(比如只造修 bug 的环境),没有横跨整个生命周期的「从零写」环境。
MindForge 是一条自动管线,把开源命令行程序转成「脱源码」训练环境,分两段。
第一段造环境,产出 cleanroom image:只含编译好的参考可执行文件和清洗过的公开文档,agent 全程看不到源码。五步走:选仓库(锁定提交)→ explorer agent 离线筛(只读源码和文档)→ builder agent 找构建方式、生成自包含构建脚本 → 行为等价性检查(在干净沙箱里重新构建,验证行为一致)→ 脱源码检查(扫二进制防止源码泄漏)。脱源码是关键:它逼着 agent 像接手一个只有黑盒二进制的真实任务那样工作,全程看不到源码。
第二段收集轨迹。用 GLM-5.2 当老师 agent,在 cleanroom 里跑完整生命周期的轨迹,再做两道精修:基础设施噪声恢复(遇到瞬时失败就回退重跑)、推理重写(删掉工具调用错误后修补悬空的推理链)。最终在 973 条轨迹上微调 Qwen3.6-27B,平均 181.6 轮、177K token。
ProgramBench 平均通过率:
| 模型 | 通过率 |
| GLM-5.2(老师) | 64.60% |
| GPT-5.5 | 56.50% |
| Claude Opus 4.7 | 51.38% |
| Sonnet 4.6 | 47.97% |
| Qwen3.6-27B(基座) | 37.98% |
| MindForge-27B(微调后) | 49.51% |
微调把 27B 从 37.98% 拉到 49.51%,反超 Sonnet 4.6,逼近更大的前沿模型。
泛化是另一处亮点。在七个没见过的 SE 基准上,它全面超过基座:RepoZero-C2Rust +31.00 个百分点(47%→78%),DeepSWE +14.16(1.76%→15.92%),NL2Repo-Bench 带/不带测试 +10.70/+4.56,SWE-bench Verified +5.04,SWE-bench Pro +5.93,SWE-bench Multilingual +5.22,FeatBench +4.94。这些任务横跨长程仓库生成与翻译、修 bug、加功能、跨语言 issue 解决。
行为上,微调后的模型明显更「耐烦」:平均轮次从 344 翻到 735.7,工具调用翻倍,但命令失败率反而从 10.98% 降到 9.35%,把推理和失败恢复真正转化成实现的比例也接近翻倍。
这篇证明了一件事:软件工程里最被前沿模型垄断的「从零造」能力,可以用自动造环境加大模型当老师蒸馏的方式下放到 27B 小模型上,而且学到的能力还能跨任务迁移。对要做本地化、私有部署或成本敏感场景的团队,这是一条比堆参数更省的路。
方法本身也可复用:562 个跨 6 种编译语言(Go、Rust、C、C++、Swift、TS)的脱源码环境,本身是个稀缺资产。
作者承认长程基准因为算力成本只跑了一次,统计稳健性有限,轨迹精修也不一定能捞尽所有真错误。和部分基准的仓库重合很小(DeepSew 2 个、SWE-bench Multilingual 3 个),作者认为任务形态根本不同、污染风险可忽略,但「可忽略」是判断不是证明。
还有一点存疑:ProgramBench 上 49.51% 和 GPT-5.5 的 56.50% 还差 7 个百分点,「逼近」是相对的;而且老师就是 GLM-5.2(64.60%),学生离老师的能力天花板还有 15 个百分点,说明这套蒸馏本身有上限。