冻结视频世界模型,Westlake用视觉证据接口做免训练镜头重拍

World in World: Explore the World with World Models

Chenxi Song, Yanming Yang, Chi Zhang

cs.CV

2026-09-10

西湖大学把源视频、投影、几何和历史状态写成冻结视频模型可读的干净视觉状态。DAVIS与OpenVid上VBench总分85.2,镜头误差低于六个训练基线。

这篇在解决什么

自回归视频世界模型已经能边走边看:改相机、改朝向,继续往后续帧。难的是控制要灵活。沿着一条新相机轨迹重看源视频,生成必须跟原事件同步,把已见内容放到新视角,补上新露出的面,回头时还要找回自己刚生成过的外观。现有方法通常为每种控制加模块、再训练。换一种证据就要改通路。

World in World(WiW)把问题收成推理时接口:异构证据先变成带相机和时间标签的干净视觉状态,冻结骨干用原生 self-attention 去读。

方法

实例化在 LingBot-World 2.0 的 causal-fast 检查点上,参数全冻。证据走同一套转换:视觉内容、逐帧相机和事件时间、token 级空间支持、以及该通道在哪个去噪步启用。干净状态以扩散时间步 t=0 过一遍骨干,缓存各层 K/V,当前块的 query 去读。

四类证据分工不同:

读的位置靠 correspondence-guided attention routing(CGAR):持久点身份加几何,把当前 query 导向对应的源视频 token。读的力度靠 evidence-wise attention CFG(EWA):同一去噪前向里比较「只看原生块」和「加上某路证据」的注意力响应,只放大与原生方向正交的那部分,不额外增加网络前向次数。

结果

任务是相机控制的视频重拍,数据 DAVIS 和 OpenVid-1M。基线包括 ReCamMaster、TrajectoryCrafter、WorldForge、InSpatio-World、UniWorld-View、CameraAnything,各用官方实现和推荐帧数。

方法VBench OverallRotError (°)TransErrorPSNR
ReCamMaster83.8367.860.12415.14
UniWorld-View84.2954.200.06922.47
CameraAnything83.0363.190.18615.16
WiW85.1922.830.06923.15

WiW 七项 VBench 平均最高,旋转误差最低,PSNR 和 SSIM 也最高。消融里拿掉目标视角 warp 最伤:旋转误差升到约 3.4 倍,平移误差约 10.9 倍(RotError 6.12 vs 1.78,TransError 0.58 vs 0.053)。去掉 CGAR 或 EWA 对相机误差影响小,主要伤主体和背景一致性。同一接口还做了子弹时间、稳像、编辑、两路生成之间的 K/V 共享和人体运动迁移。

为什么重要

对已经有冻结视频世界模型的人,这是一条不加模块、不微调的控制扩展:把控制问题变成证据怎么造、怎么对齐、怎么加权。相机重拍是主评测,接口本身不绑死在这一个任务上。

分差主要来自旋转误差,以及免训练这个约束。VBench Overall 比 UniWorld-View 高不到 1 分。如果生产环境不能动骨干,这条更有用;如果可以训专用控制头,论文没有证明一定打得过专用模型的上限。

局限与存疑

评测集中在相机控制重拍,长程回头和人体运动迁移主要靠定性图。几何通道依赖人体 avatar 和 SMPL-X,非人主体怎么补新表面,正文只给了接口,没有同等实验。深度来自 DepthCrafter,投影误差会进注意力。

表格里部分 VBench 分项 WiW 并不是第一:Temporal Flickering 93.711,低于 ReCamMaster 的 95.178。相机误差用 Depth Anything 3 和 ViPE 从生成视频反估轨迹再和目标比,估计器误差会进指标。对比方法帧数按各自官方设置,对齐后再评,仍然不是完全同设定。没有报告推理时延和显存,临时辅助注意力块的成本不清楚。

术语

原文与代码

社区讨论

相关论文

全部论文解读