VoxelTTO体素对齐3DGS,Replica测试视角PSNR到28.5

VoxelTTO: Voxel-Aligned Feed-Forward 3D Gaussian Splatting with Test-Time Optimization

Yibin Zhao, Yihan Pan, Yangwen Li, Jun Nan, Jianjun Yi

cs.CV

2026-09-18

华东理工把VFM特征聚进体素再解码高斯,测试时用LoRA按位姿微调。Replica测试视角PSNR 28.54,DepthAnything3为22.82;训练只需80 GPU小时。

这篇在解决什么

前馈 3D Gaussian Splatting 常见做法是每个像素长一个高斯。像素对齐带来大量重叠和伪影,相机位姿稍有偏差,新视角合成就会对不齐。新的视觉基础模型能从任意张图直接吐深度、点图和位姿,但几何细节和外观仍偏糊;有的方法把真值相机编码进骨干,改结构不说,推出来的位姿跟真值仍有缝。

VoxelTTO 要在任意数量图像、相机参数可给可不给的设定下,前馈出几何更干净的 3DGS,并且在有位姿先验时把测试视角对齐做好。

方法

骨干跟 DA3-GIANT 同类:DINOv2 提补丁,40 层交替注意力,冻结。另加一个特征 DPT,把补丁上采样成稠密像素特征,再按预测深度和相机反投成带颜色、特征、置信度的点云。点按体素聚合,中心是置信度加权平均,不必钉在规则格点上;体素置信度取盒内最小,用来丢掉不可靠点。稀疏卷积 U-Net 更新体素特征。每个体素用外观、几何分开的 MLP 解出 n 个高斯,默认 n=2,避免把形状和颜色绑在一次回归里。

渲染不用原版 3DGS 光栅化,改随机实心体渲染。选对空位函数时,颜色可以和 3DGS 几乎一样,深度用透射率 0.5 的中值深度,反传对这个不动点求导。论文图 3 显示 RGB 差不多,深度的破洞和糊边少很多。

测试时优化只在有对齐相机时启用。LoRA 加在第 13 到 40 层的 Q、K、V 上,各层共享降维矩阵 A、独立升维矩阵 B。损失是相对旋转、尺度归一化平移和内参,先把第一帧相机钉成单位阵。默认 20 步。训练只更新体素对齐的重建模块,可训参数 75.3M,全模型 1.39B。ScanNet、Infinigen、ARKitScenes、DL3DV-10K 上 3 万步,两张 RTX PRO 6000 跑 40 小时,也就是摘要里的 80 GPU 小时。

结果

评测在 Replica、Tanks and Temples、DTU,对照 AnySplat、YoNoSplat、DepthAnything3、MapAnything,以及需要相机的 VolSplat、MVSplat。

设定VoxelTTO最强对照
Replica 测试视角 PSNR28.54DepthAnything3 22.82
Replica 测试深度 RMSE (cm)6.945MapAnything 37.96
Replica 旋转误差均值0.220°DepthAnything3 0.324°
DTU Chamfer 总体3.416无 TTO 7.357

不加 TTO 时 Replica 测试 PSNR 已是 25.83,TTO 再抬到 28.54。Tanks and Temples 上 TTO 把测试 PSNR 从 14.71 拉到 19.23,但输入视角从 23.74 掉到 20.89,对齐测试视角会牺牲一点输入视角外观。深度在 Replica 上很强,输入 RMSE 6.167cm,测试 6.945cm;TAT 输入深度在加 TTO 后略差,测试深度明显更好。

消融:每体素 2 个高斯优于 1 个,4 个几乎不再涨。训练和推理都用体渲染时测试 PSNR 28.54,两边都改回 3DGS 光栅化掉到 21.52。体素边长 0.002m 是精度和算力的折中,0.005m 时 PSNR 掉到 23.44。十张 518 图、不含 TTO 约 2.30 秒,和 DA3 几乎一样;20 步 TTO 总时间仍低于 7.4 秒。

为什么重要

像素对齐前馈 3DGS 的重叠问题,用「先聚体素再分裂高斯」是一条干净的退路。TTO 不改 VFM 结构、不把相机 token 塞进骨干,就能把已有 VGGT 风格模型接到有位姿的场景。80 GPU 小时、只训 75.3M,对跟进的人是可承受的复现预算。

它不是免优化的魔法。有相机时才开 TTO;没有相机就退回冻结 VFM 的位姿,精度跟着骨干走。TAT 上输入视角变差,说明测试时对齐是在挪表征,不是免费的。

局限与存疑

没有独立的局限节,数字里已经露出几条缝。TAT 输入视角 PSNR 加了 TTO 反而下降,论文把它写成总提升,需要把输入/测试两列一起看。训练全是有序视频抽帧,任意无序照片集合是否同样稳,没有单独压力测试。体素尺度按 0.002m 选,场景尺度一变就要重调。随机体渲染在推理也替换了 3DGS,工程上要改渲染器,不能当即插即用的高斯播放器。代码目前在匿名仓库,相机先验依赖真值或外部 SfM,TTO 本身不从零估姿。

术语

原文与代码

社区讨论

相关论文

全部论文解读