UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models
Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan
cs.CV
2026-08-05
大偏移新视角合成常因点云渲染撕裂出错。北大 UniWorld-View 用三重重投影加法线过滤清理遮挡,拿下 WorldScore 静态分第一和零样本 NVS 三项最佳。
新视角合成(novel view synthesis,从已有画面生成新相机角度下的画面)是 VR/AR、游戏、社媒沉浸内容的基础。传统重建方法(NeRF、3D 高斯泼溅 3DGS)需要密集多视角拍摄并逐场景优化,输入稀疏时几何崩坏、遮挡处出现伪影。生成式方法(扩散模型)放松了数据要求,但把相机位姿当附属条件,没有显式三维建模,相机控制不精确。
最近一条主线是用前馈几何估计模型把单目输入提升成点云,再把点云渲染当成几何条件喂给视频扩散模型(ViewCrafter、Gen3C、Uni3C 等)。点云给了准确几何先验,但这些方法用的是朴素渲染:大偏移视角下,前景物体的纹理会被错误地拉伸到背景上,背景像素也会错投到前景,也就是「前景背景撕裂」。这种含糊的几何条件反过来毒化扩散模型的输出。
UniWorld-View 的核心是「遮挡感知点云渲染」,分两步把撕裂和背面伪影清掉。
第一步是三重重投影(Triple-Reprojection)消歧。把源画面反投影成点云,先按目标相机轨迹渲染出中间视图;再把中间视图反投影、按源相机轨迹重新渲染,得到一张可见性掩码,它能标出哪些源像素在目标轨迹下仍然有效。沿时间累积这些掩码,确保最终渲染没有前景背景撕裂。
第二步是法线过滤剔背面。点云里朝向背离目标相机的表面点会被错误投影,引入几何歧义。UniWorld-View 估计每个点的法线,只保留法线与视线方向夹角足够小的点(法线点乘视线大于 cos α),得到正面掩码。最终渲染同时套上可见性掩码和正面掩码。
渲染结果喂给一个双流条件视频扩散模型,基于 VACE(从 WAN2.1-14B 微调而来)。两个条件分工:点云渲染图加有效掩码(空间对齐但几何不完整)走 Context Blocks,负责锚定三维结构、严格执行目标轨迹;源视频(外观完整但空间错位)走新设计的 Ref-DiT 块,用交叉注意力(新视角特征做 Q、源视频做 K/V)把源画面外观聚合过来,补全被遮挡区域、修复点云导致的纹理退化。
训练分两阶段、各一万次迭代、32 卡。第一阶段用 10 万对自监督动态单目视频(OpenVid-1M,VideoDepthAnything 出深度),只训 Context Blocks、冻结 DiT 和参考分支,逼模型先学会处理不完美点云。第二阶段用 10 万组静态多视图三元组(DL3DV、RealEstate10K,VGGT 出全局点云和位姿),训 Ref-DiT 学纹理补全。输入统一 480×832、81 帧。
WorldScore 基准上,UniWorld-View 静态总分 85.53,八强中第一(超过 WorldScape-0.2 的 85.13、World Dreamer 的 84.52);三项可控性指标(相机控制 97.72、物体控制 88.98、内容对齐 86.61)全部第一,光度一致性 94.11 也是第一;动态分 76.09 排第二,仅落后 WorldScape-0.2 的 76.23。
零样本 NVS(在 RealEstate10K、CO3D、DL3DV 三个数据集上对比 See3D、Gen3C、Uni3C、SEVA):
| 数据集 | 指标 | UniWorld-View | 次优 |
| RealEstate10K | PSNR | 21.73 | 21.54(Uni3C) |
| CO3D | PSNR | 20.00 | 19.11(GEN3C) |
| DL3DV | PSNR | 15.82 | 15.41(Uni3C) |
三个数据集的 PSNR 和 SSIM 全部最佳,LPIPS 在 CO3D 最佳、DL3DV 次优。
这篇在「点云当几何条件」这条主流路线上补上了被忽视的一环:渲染本身的质量。此前大家默认点云渲染够用,只在扩散模型侧发力;UniWorld-View 证明大偏移下的撕裂和背面投影才是上限瓶颈,用三重重投影和法线过滤这种确定性几何手段就能显著拔高。对从业者,这是一套可复用的条件预处理,任何用点云渲染引导视频扩散的管线(ViewCrafter、Gen3C 同类)都能直接换上这套遮挡感知渲染。它还顺手把单目 4D 重建做成了:先生成一组时空一致的多视图视频,再喂给 4D 高斯优化,绕开了多视图采集的硬约束。
论文没有单设「局限」小节,下面一部分来自作者口径、一部分来自读后判断。WorldScore 上风格一致性(76.55)是 UniWorld-View 最弱的一项,在八强里偏低,说明生成内容与文本或参考的风格匹配不是强项;动态分只排第二,且用的是先生成参考视频再条件化生成评估视频的两阶段流程,流程本身会引入误差。零样本 NVS 上,RealEstate10K 的 LPIPS 输给 Gen3C 和 Uni3C,作者也承认这是为像素保真度和结构相似度做的折中。整条 4D 管线依赖一长串现成模型(SAM2 分割、视频修复、Stream3R、VideoDepthAnything、VGGT),工程复杂度高,单目深度和位姿估计的质量仍是隐性上限。