D3GS三重引导稀疏3DGS,三视角PSNR高2.40dB

D3GS: Depth, DINO, and RGB Diffusion Co-Guided 3D Gaussian Splatting for Sparse-View Reconstruction

Yunqi Gao, Zhanfeng Liao, Hanzhang Tu, Zhaoqi Su, Guoqing Zheng, Songtao Wang, Hongwen Zhang, Zhou Xue, Leyuan Liu, Yebin Liu

cs.CV

2026-09-19

清华等用MapAnything度量深度、DINOv3特征和单步扩散,同时稳住稀疏3DGS的几何与外观并压住漂浮伪影。Mip-NeRF 360三视角PSNR 17.69,比次优高2.40dB。

这篇在解决什么

稀疏视角下的 3D Gaussian Splatting 会同时踩三个坑。几何对不上,因为单目深度没有绝对尺度,floaters 到处漂。跨视角 RGB 还在变,灯光一换,同一根射线上的多个高斯就开始抢权重。没拍到的区域更没监督,新视角一转就糊、就缺块。

前人用相对深度正则(FSGS、DNGaussian)或生成式修图(Difix3D+)。深度不对齐时 floaters 仍在;几何已经歪了再上扩散,伪影会被放大。这篇的判断是:三个坑要同时堵,单靠 RGB 加深度不够。

方法

D3GS 把度量深度、DINO 结构特征和 RGB 扩散嵌进同一套高斯优化。高斯本身用扁平、贴表面的 PGSR 表示,再给每个高斯加一个 3 维可学习特征。

度量深度走低分辨率到高分辨率。MapAnything 先给出稀疏度量点,再做 bundle adjustment。稀疏深度经 KNN 插值后,和到锚点的距离图一起送进去噪 U-Net,得到全局一致的低分辨率度量深度,RANSAC 对齐尺度。DPT 解码器再把这张图和图像多尺度特征融合,吐出高分辨率度量深度。这张图既用来反投影初始化高斯位置,也用 L1 约束光栅化深度。

即便深度准了,跨视角颜色不一致仍会造 floaters。DINOv3 特征对同一物理点更稳。所有训练图的 DINO 特征做 PCA,只留前三维当监督。高斯把 3 维特征光栅化成特征图,用 L2 对齐。三维比 32 维更有效,低频结构一致性更强。

扩散模块不主打去 floater,主打补高频。单步扩散在 SynCamMaster 上微调:输入是退化新视角渲染,条件是参考图,目标是真图。优化先用光度损失跑 T1=3000 步打底,之后每 T2=100 步把增强后的新视角喂回高斯,损失是 L1 + LPIPS + SSIM。

结果

LLFF、DTU、Mip-NeRF 360 上按 3/6/9 视角评 PSNR、SSIM、LPIPS。RTX 3090,15000 步。

数据 / 视角D3GS PSNR次优差距
LLFF 3-view21.47BinocularGS 21.44+0.03
DTU 6-view26.04CoR-GS 24.51+1.53
Mip-NeRF 360 3-view17.69GenFusion 15.29+2.40

LLFF 三视角 LPIPS 从 BinocularGS 的 0.168 降到 0.131。DTU 六视角 LPIPS 从 0.068 降到 0.034,大约砍半。九视角 DTU 上 CoR-GS 的 PSNR 高 0.02 dB,D3GS 的 SSIM/LPIPS 仍更好。Mip-NeRF 360 三视角 SSIM 从 0.367 到 0.538,LPIPS 从 0.585 到 0.442。

子集消融(三视角):什么都没有时 DTU PSNR 16.89,加上度量深度 19.14,加上 DINO 18.03,加上扩散 17.91,三者齐 20.75。换 DepthAnythingV2 当度量深度,Mip-NeRF 360 上 PSNR 只有 12.62,自家深度模块是 17.11。扩散后处理一次不如迭代回写:DTU PSNR 19.34 对 20.75。

为什么重要

稀疏采集是航拍、室内快速扫描的常态。D3GS 把「尺度对的深度、跨视角稳的特征、生成式补洞」拆成三个可单独开关的损失,从业者可以按场景减配。度量深度模块比直接喂 DepthAnythingV2 值钱得多。扩散必须在几何稳住之后再开,否则会把错误结构补圆。

这是优化式 3DGS 的渐进组合,不是新的场景表示。训练仍要 15k 步,每场景大约 25 分钟,不适合要秒级出图的前馈路线。

局限与存疑

作者自己写了额外开销:深度、DINO、扩散让每场景大约 25 分钟。几何如果已经歪,扩散会把错误放大,消融图里看得很清楚。九视角 DTU 的 PSNR 没赢过 CoR-GS。未见区域的细节来自生成先验,可能看起来真、几何是编的。扩散在 SynCamMaster 上微调,换域要不要再训,论文没测。评测沿用已有 3/6/9 视角协议,更极端的两视角或大基线没有单独报。

术语

原文与代码

社区讨论

相关论文

全部论文解读