预训练 MLLM 当回合记忆,RoboMME 上 60.8% 超过专用记忆模块

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu

cs.RO, cs.AI

2026-08-25

Ponder 用 Qwen3.5-9B 累积回合观察,只把一个连续认知 token 异步传给 π0.5。RoboMME 在 1× 数据上 60.83%,高于 FrameSamp+Modul 的 44.51%;同接口把上下文模型从 0.8B 换到 9B 再涨 10.79 个点。

这篇在解决什么

机器人经常要靠当前画面里已经消失的信息:刚亮过的方块、被挡住的物体、演示里的顺序。人在 RoboMME 上 90.50%,只看当前观测的 π0.5 只有 17.93%,把过去动作拼进去也只到 19.73%。现有补法是给控制器加采样帧、外存、检索或压缩,每一种都是专用记忆机构。

PonderPounce 问的是另一条路:预训练多模态大模型本来就会把长视觉历史放进因果上下文,能不能直接拿来当回合记忆,而快控制器架构不动。

方法

双系统。Ponder(System 2)从 Qwen3.5-9B 初始化,把指令、可选演示、观察按时间追加进原生上下文,每步产出 K=1 个连续认知载体(隐状态,不解码、不池化)。子目标文本和演示推理只在 System 2 内部生成,默认不传给控制器。Pounce(System 1)在 RoboMME 上是 3.6B 的 π0.5,在 RoboCasa-DC 上是 3B 的 GR00T N1.5,输入当前观测、本体感觉,以及最新认知和它的正弦编码年龄。

两端端到端联合训练,没有单独的桥接预训练。有标注时,动作用流匹配,转移门、子目标和演示推理用交叉熵;RoboCasa-DC 没有这些标注,只留动作损失。评测时两个模型都是 1 Hz,动作块 20 Hz 回放。服务侧用常驻 KV cache,认知刷新 p50 78 ms,Pounce 融合核 p50 25 ms。

结果

RoboMME 16 个任务、每任务 50 回合:

方法记忆形式1× 平均9× 平均
π0.517.93-
MemER关键帧检索42.38-
FrameSamp+Modul采样帧+调制器44.5157.88
PonderPounce原生 MLLM 上下文60.8375.54

Permanence / Reference 上领先明显(1× 为 62.83 / 72.17,对照 FrameSamp 的 25.11 / 36.33)。Imitation 仍落后:1× 为 33.67 对 51.39,9× 为 48.00 对 63.00。同接口下 9B 上下文引擎 60.83%,0.8B 为 50.04%。随机初始化 9B 训崩,成功率 0。

监督很关键。去掉演示推理掉到 48.21%,去掉全部语言模型头监督掉到 27.96%。把认知换成子目标文本、只在预测转移时更新控制器,得到 59.96%,和连续认知的差距小于三次评测 2.63 个点的波动。若评测时在子目标内部停刷、重复用转移时刻的旧认知,成功率崩到 1.83%。

RoboCasa-DC 五个留出任务、跨本体演示条件下 12.5%±0.9,已发表最强基线 SeeTraceAct 11.6%;把认知换成学到的空状态是 8.6%,去掉演示是 9.0%。绝对成功率低,论文自己不把它写成全面领先。

为什么重要

记忆不必再做一个机器人专用模块,可以是「更大的预训练上下文模型 + 一条很窄的异步接口」。System 2 的容量可以单独加,快路径保持 20 Hz。对已经在用 π0.5 / GR00T 的人,这是可插的记忆层,不是重做控制器。

它不是万能记忆。模仿类任务上直接复用帧仍然更强;连续认知和子目标文本几乎打平,说明通道本身没有魔术,值钱的是上下文里累积了什么、以及刷得是否及时。

局限与存疑

RoboMME 的门控、子目标和演示推理来自仿真器模板,已发表基线没有同等文本监督,对比混了结构和监督。评测只有两个仿真基准、每个查询一个认知载体,没有真机。9B 上下文加 3–3.6B 控制器的训练和推理成本都更高,延迟是 batch-1 不是并发吞吐,上下文上限 16K。停刷实验不能代表「按稀疏接口训过的策略」;陈旧认知诊断用的是 teacher-forced 损失,不是闭环成功率。随机初始化没收敛,预训练的好处没有匹配优化下的干净对照。

术语

原文与代码

相关论文

全部论文解读