MindForge框架:小模型从零构建代码能力大幅提升
centre-for-swe · hf · 2026-07-31
当前编码 Agent 在修改现有代码库上进展显著,但从零开始构建完整程序仍面临巨大挑战,前沿模型在 ProgramBench 上的任务完全解决率不到 1%。
为突破这一瓶颈,研究者提出了 MindForge 训练管线。该管线能将开源命令行程序转化为仅暴露编译后可执行文件和文档的“无源码”训练环境。
实验表明,使用 GLM-5.2 作为教师模型生成合成轨迹,并以此微调 Qwen3.6-27B 模型,能将其在 ProgramBench 上的测试通过率从 37.98% 提升至 49.51%,媲美更大的前沿模型。此外,该微调模型在跨语言问题解决、Bug 修复等 7 个未见过的软件工程基准测试中也取得了持续的全面提升。
「编程与Agent」频道最新
- 巧用代码审查:将LLM负面指令转化为正面任务 — mattpocockuk · 2026-07-31
- 仅 126 字节代码片段致五大 Python 类型检查器连环崩溃 — charliermarsh · 2026-07-31
- HeyGen 获开源榜季度新锐奖,开源项目暴涨 300 倍 — toolstelegraph · 2026-07-31
- 微软推 Echoverse:用真实环境训练计算机控制智能体 — dejavucoder · 2026-07-31
- Prompt工程新风向:One-shot正逐渐取代Zero-shot — abacaj · 2026-07-31
- 重度开发者单月狂烧22亿Token,AI编程工具消耗惊人 — ShanRizvi · 2026-07-31