不用重训就修好视频世界模型的长程失忆,时序一致性 +15.5%、场景复现 +19.5%

Addressable Memory for Video World Models

Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep

cs.CV, cs.LG

2026-08-08

视频世界模型长生成会因 KV 缓存的 RoPE 位置超分布而失忆。WorldTrace 免重训给压缩槽分配在分布内的虚拟地址,时序一致性 +15.5%、场景复现 +19.5%。

这篇在解决什么

交互式视频世界模型(video world model)让模型一边生成画面一边响应输入,像在玩游戏。这类模型把已生成的帧存在 KV 缓存里当作「视觉记忆」,自回归地往前推。可一旦生成时长超过训练时见过的长度,记忆就开始坏。原因是模型用了 RoPE(旋转位置编码,给每帧打一个随时间旋转的角度)来标位置:时间越往后,旋转角度越大;超过训练范围,角度落进模型没见过的区间,注意机制就读不准这些旧帧了。

第二个坑更隐蔽。要省缓存就得压缩历史,最直接的做法是把多帧的 key 平均成一个槽位。但在 RoPE 旋转过的空间里直接平均,不同时刻的 key 朝向不同方向,加起来会相互抵消,这叫相位抵消(phase cancellation)。压缩出来的东西信息量被先天地破坏,跟存了什么内容无关。

方法

WorldTrace 的核心想法是让压缩后的记忆既「找得到」又「有内容」,全程不重训模型。它把注意力窗口分成两块:靠近当前帧的一段原样保留(recent window),更早的历史压成若干 summary 槽位。

第一步是给每个压缩槽位分配一个虚拟位置。按论文的定义,第 s 个槽位的时间戳被钉在当前查询位置往回数的固定偏移上,落在训练时见过的区间里。这样无论生成多长,每个槽位都始终在分布内、可被单独寻址。

第二步是在「标准空间」里做压缩,避开相位抵消。具体做法:先把每个源 key 反旋转回原始朝向(标准空间),在标准空间里平均,再用虚拟位置的角度重新旋转出去。论文证明,这样得到的槽位,查询它得到的注意力分数约等于直接查询那一组源帧的平均,信息没丢。

在这套可寻址缓存上,作者研究了两种压缩方式:

结果

作者还发布了 LoopBench:让模型沿路径走一圈再回到起点 A,看压扁的缓存能不能重建出原来的场景,用位置对齐的 CLIP 相似度(PAC)打分。实验在 Matrix-Game-2(MG2-1.3B,基于 Wan 1.3B 蒸馏的 1.3B 自回归游戏世界模型,训练上下文只有 6 个 AR chunk)上做。

设置方法结果
N=48 时序一致性 TempSSIM滑动窗口(原版)0.472
N=48 TempSSIMWorldTrace-Field0.545(+15.5%)
LoopBench ABA PAC(N=16)滑动窗口0.723
LoopBench ABA PAC(N=16)WorldTrace-Landmark0.864(+19.5%)

消融验证了两个机制的独立价值。把「naive 平均」换成「标准空间平均」,在 Ns=4 时 LatentDiff 降 25.3%(0.312→0.233);naive 平均的误差会随槽位数变多而增长,标准空间平均则不受影响。LoopBench 上,WorldTrace-Landmark 在拓扑、长度、相机转向、多次复访四类难度档位上 PAC 全部超过滑动窗口,而且绕得越久优势越大(ABA 从 N=8 到 N=32,滑动窗口从 0.859 跌到 0.627,WorldTrace 从 0.922 跌到 0.825)。最难的 360° 转向档优势收窄。

为什么重要

视频世界模型被看作通往可玩可交互虚拟世界的一条路,但长程一致性一直卡在记忆机制上。WorldTrace 的卖点是不重训:拿来就能用在已有的 temporal-RoPE 自回归模型上,把生成时长从秒级往分钟级推。对做游戏世界模型、具身智能仿真环境的人来说,这是一个低成本的工程杠杆,不需要动训练管线。

它也把一个被忽视的失效点摆到台面上:KV 缓存压缩不是「平均一下」那么简单,RoPE 旋转空间下的相位抵消是个会被继承到下游任务的隐性 bug。这一点对任何用 RoPE 长上下文加缓存压缩的场景都有参考价值。

局限与存疑

作者自己划了边界。WorldTrace 只适用于带 temporal RoPE、固定缓存预算的自回归模型,不覆盖所有世界模型架构。Field 会抹平具体细节,Landmark 依赖能不能准确检测到场景切换,挑错帧就没用。两种投影都是固定的、非自适应的,在自由移动、视角频繁切换的交互场景里可能不够。即便延长了生成时长,到了非常长的 horizon 画面仍会退化。

读下来还有一点存疑:LoopBench 的 PAC 用 CLIP 衡量「看起来像不像」,而 CLIP 偏语义、对几何与纹理细节不敏感,所以「场景复现 +19.5%」更多是说语义层面认得出来,不等于像素级重建。所有评测都集中在单一模型 MG2-1.3B 上,泛化到更大模型或别的世界模型还没验证。

术语

原文与代码

相关论文

全部论文解读