Video Generative Models as Geometry Learner
Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu, Jiankang Deng
cs.CV, cs.AI
2026-08-29
萨里大学把Stable Video Diffusion改成图、深度、法线的下一帧生成。5.9万合成样本的GeoNeXt在ETH3D上AbsRel 5.6,DepthAnything用6200万图是12.7;法线也压过同数据量的Lotus-G。
单目几何估计要同时交出深度和表面法线。判别式路线靠堆数据,DepthAnything一类模型吃掉六千多万张图,算力和伪标签噪声都贵。生成式路线改用Stable Diffusion当先验,把几何当成「一种特殊图像」来条件生成,又分两岔:Marigold、Lotus-G各自训一个任务头,深度和法线吃不到彼此的信息;GeoWizard改注意力、加切换模块做联合估计,架构离预训练更远,数据胃口跟着变大,208K还不够稳。
萨里大学和帝国理工的判断是:该换视频模型。视频扩散在大规模视频上预训练,自带跨帧注意力。如果把RGB、深度、法线当成同一条短视频里的相邻帧,那套时序先验可以直接拿来对齐「图 ↔ 几何」。
骨干是Stable Video Diffusion的image-to-video U-Net,VAE冻住。输入一张RGB,深度和法线被写成它后面的两帧。训练时三者一起加噪、一起去噪,图像也会被重建,用来钉住外观和几何的一致性。条件注入走latent拼接:几何槽先复制图像latent,再和噪声几何拼在一起。CLIP跨注意力关掉,因为要把图缩到CLIP尺寸,几何结构会被拧歪。
深度是单通道,先铺成三通道喂VAE,解码后再平均回来。数值先归到[0,1],再映射到VAE的[-1,1]。深度在disparity空间训练,预测的是仿射不变深度,不是带相机内参的度量深度。
微调只动去噪U-Net。数据是Hypersim室内约3.9万有效样本,加上Virtual KITTI 2约2万驾驶帧,每个batch按9:1抽。推理用EDM采样,默认5步去噪,再对5个噪声种子做ensemble。
零样本深度(AbsRel越低越好):
| 方法 | 训练量 | NYUv2 | KITTI | ETH3D |
| DepthAnything | 62.6M | 4.3 | 7.6 | 12.7 |
| Lotus-G(只做深度) | 59K | 5.4 | 8.5 | 5.9 |
| GeoWizard | 208K | 5.6 | 14.4 | 6.8 |
| GeoNeXt | 59K | 5.3 | 8.2 | 5.6 |
室内NYU仍落后DepthAnything,ETH3D这种室内外高分辨率反过来拉开一截:12.7对5.6。KITTI上比GeoWizard的14.4好很多,仍略逊DepthAnything的7.6。DIODE上AbsRel 22.6,低于GeoWizard的33.0。
法线平均角误差:NYUv2 16.7°(Lotus-G 16.6°,GeoWizard 18.9°,DSINE 16.4°),iBims-1 16.4°,Sintel 33.0°。统一模型在多数集上压过同设定的GeoWizard,和专训法线的Lotus-G、E2E-FT咬在一起。
消融里,拿掉图像重建,NYU深度AbsRel从5.3掉到6.5;分开训深度/法线也全面变差。深度、法线谁当第几帧几乎无差。A5000上768输入,单次预测约1.0秒(1.5B参数),5×5 ensemble约10秒;Marigold 50×10 ensemble要180秒。
几何估计不必再为每个任务单开一个扩散模型,也不必先改架构再喂几十万标注。视频模型的跨帧注意力在这里被复用成模态对齐,59K合成三联就能在若干零样本集上接近甚至超过吃大数据的判别式模型。下游论文演示了可控生成、重打光和网格重建,主文没有给这些应用的量化分数。
部署上仍是扩散:比DepthAnything慢一个数量级以上,适合离线几何,不适合车端每帧都跑。
论文没有单独的局限节。训练全是合成室内外,真实域只出现在测试。预测的是仿射不变disparity,不能当度量深度用。骨干还是SVD时代的U-Net,文中声称可接到WAN这类DiT,主文没给数字。ensemble的5×5是默认成绩,单次已经不错,但延迟仍以秒计。和DepthAnything的对比也不均匀:ETH3D大胜,NYU、KITTI仍落后。没有在真实深度标注上做联合微调,也没有测视频序列的时序一致性,尽管它借的是视频模型。