Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution
Changzhi Liu, Yilun Liu, Sikuan Yan, Volker Tresp, Yunpu Ma
cs.AI, cs.LG
2026-08-08
MGM 给自我改进的编程智能体加了两类基于档案对比的改写算子(跨任务反应规范、跨谱系杂交),让 Qwen3.6-35B-A3B 的支架在 Polyglot 从 50.8% 涨到 93.2%,迁移到 DeepSeek-V4-Pro 后到 96.9%,参数量约为 GPT-5 的 1/117。
自我改进的编程智能体能迭代改写自己的源码来变强。已有的工作(DGM、HGM)维护一棵不断生长的「档案树」,记录所有生成过的智能体变体和它们在每个任务上的执行轨迹,每一轮从中采样一个去改写。问题在于,每次改写只看一个智能体在一个任务上的一条失败轨迹,而档案里其实堆满了可资利用的对比信号:同一个智能体在多个任务上的成败模式、不同智能体在同一任务上的不同表现。这些都被当成排行榜用掉了,没有喂给改写过程。
MGM(Mendel Gödel Machine,孟德尔哥德尔机)沿用 HGM 的树搜索骨架(选择、评估、扩展),把原来单一的改写算子拆成三类,按档案里能凑出的对比证据来选用:
杂交并不把一个智能体的源码剪贴到另一个里:它让失败的那个智能体自己去从参照轨迹里提炼出可迁移的行为特征,改写进自己的代码。为了给杂交创造条件,MGM 还维护一个「失败任务池」,给那些暴露过失败的任务加权,让不同谱系更可能在同一批任务上撞车,从而凑出可比对的样本。这套设计不额外花任何任务评估次数。
作者还用一个加性适应度景观模型(把智能体表示成二进制基因型,离最优基因型的汉明距离衡量进步)从理论上证明,更丰富的对比证据能提高一次改写命中真正缺陷的概率,收敛比单轨迹基线更快,并用蒙特卡洛模拟验证。
所有实验都用 Qwen3.6-35B-A3B,同样的 200 次评估预算:
| 设置 | 初始 | HGM | MGM |
| Polyglot-60 | 50.8% | 77.9% | 93.2% |
| SWE-bench Verified-60 | 68.3% | 73.3% | 78.3% |
Polyglot 上 MGM 把 50.8% 拉到 93.2%,绝对提升 42.4 个百分点,是 HGM 的两倍多。完整 225 题 Polyglot 上,把 Qwen 演化出的支架直接换到 DeepSeek-V4-Pro 上跑,拿到 96.9%,以约 117 倍更少的参数超过闭源的 GPT-5。
泛化上也成立。在 Polyglot 上演化出的支架零样本迁移到 SWE-bench Pro 和 Multilingual,MGM 两个都是正迁移(+10.0、+13.3 个百分点),HGM 在 Pro 上是负迁移。换掉推理主干(DeepSeek-V4-Flash/Pro)后支架仍然有效。
消融去掉反应规范突变,Polyglot 掉到 79.7%;去掉跨谱系杂交掉到 74.6%,杂交更关键。
MGM 改的是智能体的支架(prompt、工具调用流程、工作流),而不是底层模型的参数。这意味着演化出的改进是可复用的工作流级技能,能跨基准、跨模型迁移。对从业者来说,路径很具体:在便宜的小模型和小数据集上演化支架,再把成品支架挂到更强的模型上。这篇把「自我改进」的瓶颈从「档案怎么存、怎么采样」推进到了「每次改写拿什么当证据」,而且证据全是评估过程中本来就在产生的副产品,不额外烧评估预算。
作者自己列得很清楚。一是贵:仓库级任务的演化和评估吃大量机时和 GPU,所以独立种子和超参扫描都报得少。二是依赖历史:反应规范突变要同一智能体多条轨迹,杂交要不同谱系在同一任务上撞车,档案小、任务重叠稀疏时 MGM 退化成单轨迹基线。三是不保证改对:证据质量高不等于改出来的代码对、通用、可维护,最终的支架修改还是 LLM 编辑器在做,失败的改写会浪费预算。四是理论分析用的加性适应度代理模型做了简化假设,不能完全代表真实可编辑的智能体空间。