镜头回环就穿帮:零训练借引擎位姿修好长视频自回归一致性

Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering

Wenchao Ma, Changran Liu, Sharon X. Huang, Haomiao Jiang

cs.CV

2026-07-24

自回归视频生成在镜头回环时画面会变样,这篇不重训,用引擎给的相机位姿和深度检索历史帧做回环记忆,关键点匹配近翻倍,画质不掉。

这篇在解决什么

条件式视频生成模型能把 3D 引擎的输出(深度图、无纹理几何体)转成逼真视频,用在游戏和沉浸式内容里。这类应用要求长时间自回归生成:一段段(chunk)往后续写,同时维持一个一致的 3D 世界。

问题是,自回归生成器用有界的 KV cache 一段段往前推,cache 装不下旧的上下文就会被驱逐。镜头转一圈回到之前去过的地方时,模型手里已经没有那段记忆,只能凭条件(比如深度图,它倒是还对得上几何)重新脑补外观,结果同一面墙、同一个物体的纹理、颜色、结构会变样。条件没错,生成不一致。

方法

作者用了一个零训练(无需后训练)的办法,直接复用 3D 引擎本来就能给的对应关系,思路接近 SLAM 里的回环检测(loop closure)。

关键设计是只偏置注意力打分,绝不扭曲或混合 cache 里的 key、value、latent,免得把缓存内容磨糊。方法本身挂在 Causal Wan-VACE(深度条件版的 Wan 视频生成器)上。

结果

在从 TartanGround 和 TartanAir 里挖出的回环轨迹上测,对比四个零训练基线(Self-Forcing、Infinity-RoPE、MemRoPE、Deep Forcing)。

数据集指标Self-Forcing本方法
TartanGround高置信关键点匹配23.2649.08(近翻倍)
TartanGroundDINO 相似度0.60870.6904
TartanAir关键点匹配195.65284.92
TartanAirDINO 相似度0.76230.8407

整体视频质量(VBench-Long)同时拿到最优,没有为了回环一致性牺牲画面。消融实验里,attention sink 负责稳住全局外观防漂移,pose retrieval(位姿检索)是回环一致性提升的主因。

为什么重要

回环不一致是长时长自回归视频生成里一个很具体、很碍事的故障,这篇给了一个不重训就能用的解法,对做游戏实时渲染、长视频生成的工程团队有直接价值。它也示范了「引擎能给什么对应关系,就拿来约束生成器」这个更通用的思路。

局限与存疑

依赖引擎给出的相机位姿和度量深度。换到真实拍摄的视频上,这些得靠估计(比如 VGGT),估计噪声会带进对应关系,作者说高斯偏置的软约束就是设计来容忍这种噪声的,但没在真实视频上验证。只在 Wan-VACE 上做的,迁移到别的自回归视频模型是否同样有效不清楚。

术语

原文与代码

相关论文

全部论文解读