World in World: Explore the World with World Models
Chenxi Song, Yanming Yang, Chi Zhang
cs.CV
2026-09-10
西湖大学把源视频、投影、几何和历史状态写成冻结视频模型可读的干净视觉状态。DAVIS与OpenVid上VBench总分85.2,镜头误差低于六个训练基线。
自回归视频世界模型已经能边走边看:改相机、改朝向,继续往后续帧。难的是控制要灵活。沿着一条新相机轨迹重看源视频,生成必须跟原事件同步,把已见内容放到新视角,补上新露出的面,回头时还要找回自己刚生成过的外观。现有方法通常为每种控制加模块、再训练。换一种证据就要改通路。
World in World(WiW)把问题收成推理时接口:异构证据先变成带相机和时间标签的干净视觉状态,冻结骨干用原生 self-attention 去读。
实例化在 LingBot-World 2.0 的 causal-fast 检查点上,参数全冻。证据走同一套转换:视觉内容、逐帧相机和事件时间、token 级空间支持、以及该通道在哪个去噪步启用。干净状态以扩散时间步 t=0 过一遍骨干,缓存各层 K/V,当前块的 query 去读。
四类证据分工不同:
读的位置靠 correspondence-guided attention routing(CGAR):持久点身份加几何,把当前 query 导向对应的源视频 token。读的力度靠 evidence-wise attention CFG(EWA):同一去噪前向里比较「只看原生块」和「加上某路证据」的注意力响应,只放大与原生方向正交的那部分,不额外增加网络前向次数。
任务是相机控制的视频重拍,数据 DAVIS 和 OpenVid-1M。基线包括 ReCamMaster、TrajectoryCrafter、WorldForge、InSpatio-World、UniWorld-View、CameraAnything,各用官方实现和推荐帧数。
| 方法 | VBench Overall | RotError (°) | TransError | PSNR |
| ReCamMaster | 83.836 | 7.86 | 0.124 | 15.14 |
| UniWorld-View | 84.295 | 4.20 | 0.069 | 22.47 |
| CameraAnything | 83.036 | 3.19 | 0.186 | 15.16 |
| WiW | 85.192 | 2.83 | 0.069 | 23.15 |
WiW 七项 VBench 平均最高,旋转误差最低,PSNR 和 SSIM 也最高。消融里拿掉目标视角 warp 最伤:旋转误差升到约 3.4 倍,平移误差约 10.9 倍(RotError 6.12 vs 1.78,TransError 0.58 vs 0.053)。去掉 CGAR 或 EWA 对相机误差影响小,主要伤主体和背景一致性。同一接口还做了子弹时间、稳像、编辑、两路生成之间的 K/V 共享和人体运动迁移。
对已经有冻结视频世界模型的人,这是一条不加模块、不微调的控制扩展:把控制问题变成证据怎么造、怎么对齐、怎么加权。相机重拍是主评测,接口本身不绑死在这一个任务上。
分差主要来自旋转误差,以及免训练这个约束。VBench Overall 比 UniWorld-View 高不到 1 分。如果生产环境不能动骨干,这条更有用;如果可以训专用控制头,论文没有证明一定打得过专用模型的上限。
评测集中在相机控制重拍,长程回头和人体运动迁移主要靠定性图。几何通道依赖人体 avatar 和 SMPL-X,非人主体怎么补新表面,正文只给了接口,没有同等实验。深度来自 DepthCrafter,投影误差会进注意力。
表格里部分 VBench 分项 WiW 并不是第一:Temporal Flickering 93.711,低于 ReCamMaster 的 95.178。相机误差用 Depth Anything 3 和 ViPE 从生成视频反估轨迹再和目标比,估计器误差会进指标。对比方法帧数按各自官方设置,对齐后再评,仍然不是完全同设定。没有报告推理时延和显存,临时辅助注意力块的成本不清楚。