冻结 LLM 用可修订规则手册学世界模型,ARC-AGI-3 全 25 游戏满分

Memento 3: Model-Based Recursive Self-Improvement through Reflective Rulebooks

Haoyu Zhao, Zhengxu Yu, Zhiyuan He, Meng Fang, Rasul Tutunov, Haitham Bou-Ammar, Weilin Luo, Jun Wang

cs.AI, cs.CL, cs.CV, cs.LG

2026-10-08

冻结 LLM 把环境假设写成规则手册并编译成代码用于规划,ARC-AGI-3 全部 25 个公开游戏 RHAE 满分,总动作数仅为人类的 44%。

这篇在解决什么

LLM agent 进一个陌生游戏,卡点通常不在想不出好动作,在不知道世界怎么运转。代码世界模型是已有路线:把环境规则写成可执行的转移函数,规划器直接在里面搜索。问题出在泛化。有限的交互历史总会留下多个都能自圆其说的程序,它们复现了全部已观测转移,却在未见状态上预测不同。论文的例子:见过的墙全在第 7 列时,「箱子撞墙停」和「箱子到第 7 列停」解释同一段轨迹,换一堵墙才分出对错。重放能淘汰不一致的程序,挑不出一致程序里哪个对。Memento 系列前作改的都是策略侧,情节记忆、可复用技能;这篇补模型侧:环境规则怎么被显式学出来、存下来、持续修订。

方法

核心设计叫 Code as Model,一对 artefact:

两个表示的分工是刻意的:手册管规则级推理,可检查、可回滚;代码固定规则怎么被执行。实现写错只修代码;对环境的理解变了,必须先写进手册再编译。新代码要过两道门才被接受:LLM 判断代码忠实于手册,加上 cell-exact replay 逐格复现历史里每一次转移,失败就回到反思重写。这把「LLM 觉得对」换成「跑通全部历史」。

运行是五步循环:观测、反思(保留/改规则/修代码)、改规则、编译、验证。通过的模型交给规划器在可执行模型里搜最短路;执行时逐步比对预测与观测,第一处失配就停,反例喂回反思。模型历史存进 Git 仓库,agent 能 diff 版本、找回被改坏的旧实现。多个候选同时通过验证时,偏好描述最短的手册加代码,一个 MDL 式的简洁偏好。

单模型有自我确认的隐患:错误但未被戳穿的假设,它选的动作可能永远不暴露它的错。群体扩展让 N 个模型共享同一份交互历史,每个规划回合采样一个行为等价类去执行,被证伪的成员单独修复,N=1 退回单模型。骨干是 Claude Opus 5 跑在 Claude Code、推理力度 extra-high,全程冻结;harness 在 baseline1 的代码库基础上搭建,论文有披露。

结果

主实验覆盖全部 25 个公开游戏,只有发给环境的真实动作计入预算,规划、重放、建模不占:

方法通关游戏平均 RHAE
Continual Harness3/2520.5
DreamTeam6/2538.1
OPINE-World20/2578.4
NOOA19/2585.1
baseline125/2599.0
Memento 3(单模型)25/25100.0

RHAE 100 是上限,要求每关都过且效率达标。总动作 7,518 步,为人类基线 17,135 步的 44%;唯一同样全通的 baseline1 用了 8,347 步(49%)。同一骨干模型配 ARC Prize 标准 harness 要低 59.3 分,这组对照把脚手架本身的贡献分离了出来。

消融去掉手册、只留代码世界模型,三个难度带各选一局:通关不变,动作从 617 涨到 677(+9%),agent 轮次从 678 涨到 830(+18%)。群体扩展只在 wa30 一局试了 N=2:动作从 899 降到 597,九关里八关持平或更好。

Pong 案例把规划换成反馈控制:学出的模型驱动一个控制器,三种不同开局各打一局,全部 21:0,执行期零 LLM 调用。学习成本 9,504 帧,是 EfficientZero 报告预算 4×10⁵ 帧的 1/42,约为 model-free RL 基线 2×10⁸ 帧的两万分之一。同一个 LLM 不带世界模型直接玩,得 -19。

为什么重要

对做 agent 的人,这篇支持一个工程判断:陌生环境里,把「显式假设 + 可执行实现 + 逐格验证」做成外挂记忆,比把理解全留在上下文里收敛快,消融里 18% 的轮次差就是手册的净贡献。59.3 分的 harness 对照说明同一个模型换脚手架能差出一截。Pong 的数字更实用:控制器脱离 LLM 独立运行,学习成本比 RL 低两到四个数量级,适合动作便宜、样本贵的场景。Git 版本化的模型记忆是可以直接抄的细节,回滚能力让激进改规则不致命。

也得说清楚:公开集上对 baseline1 的优势是 1.0 分和约 10% 的动作数,渐进改进;真正可复用的是验证闭环和动作效率这套口径。

局限与存疑

论文自认的:公开集正被强模型打穿,通关数本身分离不出架构贡献,需要比模型选择、推理预算、重复运行稳定性和 held-out 评测;代码-手册一致性靠 LLM 语义判断,不是精确判定;MDL 偏好不消除不确定性,单模型可能自我确认,群体只是版本空间的计算近似,不是校准的后验。

读下来另有几处。消融只有三局,群体只有一局且 N=2,样本撑不起强结论,作者给的理由是 Claude Code 单次运行的时间和钱都不低。Pong 在第一次打出 21:0 就停止学习,评测的正是这个检查点,各基线又各有评测协议,方向可信、精度别当真;全帧重放也承认残留渲染与对手板运动误差。方法整体压在 Claude Opus 5 的 extra-high 推理上,复现成本论文没给数。

术语

原文与代码

社区讨论

相关论文

全部论文解读