Addressable Memory for Video World Models
Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep
cs.CV, cs.LG
2026-08-08
视频世界模型长生成会因 KV 缓存的 RoPE 位置超分布而失忆。WorldTrace 免重训给压缩槽分配在分布内的虚拟地址,时序一致性 +15.5%、场景复现 +19.5%。
交互式视频世界模型(video world model)让模型一边生成画面一边响应输入,像在玩游戏。这类模型把已生成的帧存在 KV 缓存里当作「视觉记忆」,自回归地往前推。可一旦生成时长超过训练时见过的长度,记忆就开始坏。原因是模型用了 RoPE(旋转位置编码,给每帧打一个随时间旋转的角度)来标位置:时间越往后,旋转角度越大;超过训练范围,角度落进模型没见过的区间,注意机制就读不准这些旧帧了。
第二个坑更隐蔽。要省缓存就得压缩历史,最直接的做法是把多帧的 key 平均成一个槽位。但在 RoPE 旋转过的空间里直接平均,不同时刻的 key 朝向不同方向,加起来会相互抵消,这叫相位抵消(phase cancellation)。压缩出来的东西信息量被先天地破坏,跟存了什么内容无关。
WorldTrace 的核心想法是让压缩后的记忆既「找得到」又「有内容」,全程不重训模型。它把注意力窗口分成两块:靠近当前帧的一段原样保留(recent window),更早的历史压成若干 summary 槽位。
第一步是给每个压缩槽位分配一个虚拟位置。按论文的定义,第 s 个槽位的时间戳被钉在当前查询位置往回数的固定偏移上,落在训练时见过的区间里。这样无论生成多长,每个槽位都始终在分布内、可被单独寻址。
第二步是在「标准空间」里做压缩,避开相位抵消。具体做法:先把每个源 key 反旋转回原始朝向(标准空间),在标准空间里平均,再用虚拟位置的角度重新旋转出去。论文证明,这样得到的槽位,查询它得到的注意力分数约等于直接查询那一组源帧的平均,信息没丢。
在这套可寻址缓存上,作者研究了两种压缩方式:
作者还发布了 LoopBench:让模型沿路径走一圈再回到起点 A,看压扁的缓存能不能重建出原来的场景,用位置对齐的 CLIP 相似度(PAC)打分。实验在 Matrix-Game-2(MG2-1.3B,基于 Wan 1.3B 蒸馏的 1.3B 自回归游戏世界模型,训练上下文只有 6 个 AR chunk)上做。
| 设置 | 方法 | 结果 |
| N=48 时序一致性 TempSSIM | 滑动窗口(原版) | 0.472 |
| N=48 TempSSIM | WorldTrace-Field | 0.545(+15.5%) |
| LoopBench ABA PAC(N=16) | 滑动窗口 | 0.723 |
| LoopBench ABA PAC(N=16) | WorldTrace-Landmark | 0.864(+19.5%) |
消融验证了两个机制的独立价值。把「naive 平均」换成「标准空间平均」,在 Ns=4 时 LatentDiff 降 25.3%(0.312→0.233);naive 平均的误差会随槽位数变多而增长,标准空间平均则不受影响。LoopBench 上,WorldTrace-Landmark 在拓扑、长度、相机转向、多次复访四类难度档位上 PAC 全部超过滑动窗口,而且绕得越久优势越大(ABA 从 N=8 到 N=32,滑动窗口从 0.859 跌到 0.627,WorldTrace 从 0.922 跌到 0.825)。最难的 360° 转向档优势收窄。
视频世界模型被看作通往可玩可交互虚拟世界的一条路,但长程一致性一直卡在记忆机制上。WorldTrace 的卖点是不重训:拿来就能用在已有的 temporal-RoPE 自回归模型上,把生成时长从秒级往分钟级推。对做游戏世界模型、具身智能仿真环境的人来说,这是一个低成本的工程杠杆,不需要动训练管线。
它也把一个被忽视的失效点摆到台面上:KV 缓存压缩不是「平均一下」那么简单,RoPE 旋转空间下的相位抵消是个会被继承到下游任务的隐性 bug。这一点对任何用 RoPE 长上下文加缓存压缩的场景都有参考价值。
作者自己划了边界。WorldTrace 只适用于带 temporal RoPE、固定缓存预算的自回归模型,不覆盖所有世界模型架构。Field 会抹平具体细节,Landmark 依赖能不能准确检测到场景切换,挑错帧就没用。两种投影都是固定的、非自适应的,在自由移动、视角频繁切换的交互场景里可能不够。即便延长了生成时长,到了非常长的 horizon 画面仍会退化。
读下来还有一点存疑:LoopBench 的 PAC 用 CLIP 衡量「看起来像不像」,而 CLIP 偏语义、对几何与纹理细节不敏感,所以「场景复现 +19.5%」更多是说语义层面认得出来,不等于像素级重建。所有评测都集中在单一模型 MG2-1.3B 上,泛化到更大模型或别的世界模型还没验证。