VGGT 几何路由进视频扩散,1K 场景拿下稀疏视角合成

VGGT-Diff: Visual Geometry Meets Diffusion for Sparse-View Novel View Synthesis

Kangjie Chen, Xiangyu Li, Dongbin Zhang, Chaoda Zheng, Shijia Chen, Jinhao Deng, Hongbin Lin, Choo Sin Wai, Minqi Wang, Minghao Yang, Dake Zhong, Guorui Song, Yu Zhang, Xianming Liu, Boyang Wang

cs.CV, cs.AI

2026-09-27

把 VGGT-Ω 的 3D 点与置信度注入 Wan 视频扩散做稀疏视角合成,DL3DV PSNR 18.104,超同骨干 FrameCrafter 0.92 dB,只用约 1K 训练场景。

这篇在解决什么

稀疏视角新视角合成(NVS)长期分两派。重建派(NeRF、3DGS、LVSM 这类前馈模型)保得住已观测区域的几何,但视角拉远后没拍到的部分无米下锅,预测会退化成偏向源图颜色的色块;扩散派借图像/视频生成先验补全看不见的内容,但源图到目标视角的对应关系是隐式的,生成先验经常压过几何证据,结果是结构漂移、遮挡乱跳、跨视角不一致。

这篇(小鹏汽车、香港中文大学、清华)把两条线焊在一起:用视觉几何基础模型 VGGT-Ω 提供显式的 3D 点、对应关系和置信度,去锚定预训练视频扩散模型 Wan2.1-I2V-14B。

方法

核心思路是「几何作为条件,不是场景重建」。三个组件:

两个工程选择:训练时对几何条件随机丢弃(10%)或衰减(20%),防止模型把不完美的投影当真理;这个 dropout 还解锁了推理时的 Geometry-Prior CFG,在去噪早期加强几何引导。

结果

DL3DV 上 6,188 个目标、6 源视图,训练只用 980 个场景(同表 AnySplat 用了 254K):

方法PSNRSSIMLPIPSDreamSim
LVSM17.0900.4780.3330.204
SEVA16.1500.4700.2530.088
FrameCrafter(同 Wan2.1-14B)17.1800.4450.2230.066
VGGT-Diff18.1040.5080.2220.062

SSIM 全场第一是回归派 DepthSplat 的 0.566。最有说服力的是同骨干、同量级数据的 FrameCrafter 对比:PSNR +0.924 dB、SSIM +0.063。零样本迁移 Mip-NeRF 360,LPIPS 和 DreamSim 第一,PSNR 第二(E-RayZer 更高,但感知误差大得多)。

按视角难度分层(插值/外推 × 近/中/远):六格里五个第一,插值-近输 SEVA 0.020 dB,对 FrameCrafter 的优势在 0.582–1.228 dB。跨视角一致性用两个冻结重建器去重建 8 张联合生成图,Chamfer-L1 比 FrameCrafter 降 26.7%(VGGT-Ω 评估)和 16.4%(Pi3 评估,训练中未用过),两个裁判结论一致,排除了自家人当裁判的嫌疑。

消融里,去掉全部 VGGT-Ω 组件掉 1.730 dB,是最大单项;去 PTRC 掉 0.438 dB;条件正则掉 0.302 dB;推理时 CFG 只 +0.115 dB。把 PTRC 换成直接对齐速度场,PSNR 从 18.581 掉到 17.769,收益确实来自「对齐残差」这个形式本身。附录还有两条:数据扩到 10K、步数 18K 拉到 100K,PSNR 从 18.79 涨到 20.28,尚未饱和;只给 3 或 4 个源视图(训练固定 6 个)不重训,四项指标仍全面赢 FrameCrafter。

为什么重要

对做 3D 生成与重建管线的人,这篇验证了一个可复用的方向:几何基础模型的特征带着 3D 点和置信度,可以直接当扩散模型的显式条件,不需要先重建出完整 3D 场景。数据效率实打实,1K 场景加借来的 Wan 先验就够,小团队可复现。PTRC「对齐误差而非预测」的形式也可以搬到其他多视角生成任务。

局限与存疑

作者自述的:跨视角一致性参照是 GT 视图重建出的点云而非物理扫描,只能算相对度量;联合去噪的显存开销限制视角数,需要分块生成;只处理静态场景;联合微调 VGGT-Ω 反而掉 0.647 dB,几何编码器只能冻结着用。

读下来再补三点:14B 骨干加 50 步采样的推理成本全文没讨论;总表协议沿用 FrameCrafter,回归派在 Mip-NeRF 360 的 PSNR 和 SSIM 上仍占优,跨派系结论要看分层数字;标题级的 SOTA 在 Mip-NeRF 360 上只对 LPIPS 和 DreamSim 成立。论文是 preprint,未经同行评审。

术语

原文与代码

相关论文

全部论文解读