Meta$^n$: Recursive Self-Improvement through Emergent Depth
Zae Myung Kim, Young-Jun Lee, Seungyeon Jwa, Dongyeop Kang
cs.AI, cs.CL, eess.SY
2026-08-25
明尼苏达Meta^n把元操作Ω冻住、对越来越厚的输入反复递归,八类基准全面超过OpenEvolve与Gödel Agent;ARC-AGI-2上archive-best为0.331,两条基线几乎贴地。
现有「自我改进」智能体多半在改答案,不在改产生答案的流程。FunSearch、AlphaEvolve、ADAS 在外面挂一层固定的进化或搜索,改进器本身不动,实现的元深度是 1。Gödel Agent、DGM 让智能体改自己的源码,但为了不把自己改崩,总要冻住一层驱动,实现的元深度卡在大约 2.5。递归改进器能换深度,稳定就要冻驱动,冻驱动深度又上不去。
明尼苏达大学的 Meta^n 换了递归对象:元操作 Ω 冻住,递归施加在它的输入上。
Ω 是一条固定提示。每一层读下方整栈在全部任务上的执行痕迹,从第 3 层起还读前面各层写出的代码,然后吐出下一层:一段在求解前注入的战略预处理,外加求解器可调用的辅助函数库。包装器把新层套在旧求解器外面,预处理上下文从上往下传,函数库按名字合并、深层覆盖浅层。Ω 自己不变,所以改不崩;输入严格变厚,所以每一层看到的比上一层高一阶。
深度不预先指定,Ω 吐空代码、连续若干层涨幅不够、或碰到上限才停。实践中跑到第 3 到第 6 层就停,是 Ω 找不到新改进,不是上下文塞满。线性加深怕一次坏注入把整条链掐死,所以还有进化档案:按分数加探索奖励抽父链,每个父链生多个子层,档案同时记每道题的历史最好,报告 archive-best。层与层会互相干扰,第 3 层常把第 2 层还能用的策略盖掉,第 4 层再回滚。
求解器可以是一次 LLM 调用,也可以是最多 8 轮的 observe-act。同一套 Ω 模板跑完全部八类基准。
两条骨干:Gemma 4 31B-IT 和 GPT-5.2。八类基准覆盖组合优化、文本分类、终端任务、数学发现、符号回归、算法加速和 ARC-AGI-2。
| 设置 | Meta^n archive-best | OpenEvolve | Gödel Agent |
| Gemma / CO-Bench | 0.851 | 0.814 | 0.451 |
| GPT-5.2 / CO-Bench | 0.870 | 0.702 | 0.527 |
| GPT-5.2 / ARC-AGI-2 | 0.331 | 0.003 | 0.054 |
| Gemma / LawBench | 0.815 | 0.745 | 0.775 |
GPT-5.2 上 CO-Bench 比 OpenEvolve 高 0.168,种子区间不相交。ARC-AGI-2 按 pass@2,archive-best 0.331,最好单链只有 0.123,两条基线贴地;论文写明 held-out 分割上只有 Meta^n 解出过题。去掉递归(depth-1)在 Gemma CO-Bench 上从 0.845 掉到 0.714,递归本身贡献 +0.131。拆通道:层间战略上下文字符串约占递归收益的 72%,可调用函数库约 15%,其余约 13%。Gödel Agent 即使把预算加到 10 倍,GPT-5.2 CO-Bench 也只到 0.628,到不了 Meta^n 的 0.870。
第 2 层几乎全是通用原语,simulatedannealing 会传到 15/36 个 CO-Bench 赢家。第 3 层开始专化,41% 的(链,题)对在这一层严格回退。第 4 层及以后做回滚和修补。没有提示规定角色,两个独立评分模型都标出了这套随深度出现的分工。
它把「自我改代码」和「冻住改进器」拆开了。想要超过两层的元深度,不一定要让改进器改自己,给它越来越厚的输入就够。收益大头来自上层传给下层的那串战略上下文,不是函数库。这对想做递归自我改进的人是个更便宜的旋钮:先把层间条件传对,再谈让 Ω 自己进化。
它也标出了不适用的地方。AlgoTune 的核已经被种子抽出来,Ω 的额外上下文会把代码写死,agentic 版平均 ×15.10,单次调用版反而到 ×18.47。SWE-Bench 上种子已经够强,档案最优是第 0 代,Ω 根本没启动。提示改写类基准(Symptom2Disease)动作面太窄,相对 OpenEvolve 的优势落进种子噪声。
作者自己写了:基座求解器和每一层 Ω 用的是同一个模型,用来隔离「深度」和「能力」,但没测更强模型只坐在 Ω、弱模型坐在求解器这种更接近部署的搭配。跑到第 3 到第 6 层就停,更深有没有用还没测。archive-best 比最好单链高 0.06 到 0.07,意味着真正吃到乘法覆盖,要按题选链,线上若只能部署一条链,表上的头排数字会缩一截。ARC-AGI-2 的 0.331 是 dev 分数,held-out 只说「过零、基线全零」,没给具体数字。Gödel Agent 的公开单求解器接口在 CO-Bench 上会塌成约 0,表里用的是他们改过的按题配置。