Self-Geometry:免标注给 3D 视觉大模型补多视图几何

Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models

Seokhyun Youn, Dahyeon Kye, Sung-Ho Bae, Jihyong Oh

cs.CV

2026-08-11

Self-Geometry 用像素匹配当伪真值,免标注给六种 3D 视觉大模型补多视图几何,姿态与深度估计一致改善,每场景两分钟。

这篇在解决什么

VGGT、π³、Depth Anything 3 这类视觉基础模型(VFM)能在一次前向里同时预测深度、相机姿态和点云图(pointmap,每个像素的三维坐标),泛化不错。但它们在预训练时没有强制多视图几何一致,因为做束调整(bundle adjustment,同时优化所有相机姿态和三维点的经典几何方法)那种显式约束太贵。所以预测里会冒出几何不一致,尤其模型本身就不准时更明显。

之前的测试时自适应(TTA)方法用「隐式自一致」信号,从模型输出的点云或特征里挤出来去间接修正,收益有限。代表方法 Free-Geometry 在姿态、深度上几乎不动,点云只略微改善。

方法

Self-Geometry(中央大学 CMLab)的关键观察是:测试时由外部特征匹配器 LightGlue 抽出的 2D 像素对应,本身就是显式多视图几何监督,可以当伪真值用,不需要任何标注。

三个组件:

结果

跨六种 VFM(VGGT、π³、DA3-Giant/Large/Base/Small)和四个数据集(7Scenes、ETH3D、ScanNet++、HiRoom),姿态与几何估计普遍提升,而且是六种里均值提升最大的。

场景指标Self-Geometry
宽基线户外(VGGT, ETH3D)姿态 AUC@3+37.3%
室内细结构(DA3-Small, HiRoom)几何 F1(w/o pose)+70.4%

两个对照基线表现差得多:Free-Geometry 几乎不动,TCO 在 π³ 上直接崩盘(均值姿态 AUC@3 减 91.5%)。规律是基线模型越弱,Self-Geometry 涨得越多,DA3-Small/Base 在 HiRoom 的几何 F1 涨了 70% 到 85%,说明它特别适合「欠拟合」的模型。每场景不到两分钟(单卡 RTX PRO 6000),远比传统束调整便宜。

为什么重要

给用 3D VFM 做重建的人一个即插即用的增强:不用标数据、不用蒸馏老师模型、不限特定架构,推理时每场景花两分钟就能把几何一致性补上。对已经很强的模型(如 VGGT 在 ScanNet++)提升很小甚至个别指标略降,它的价值主要在弱模型和困难场景(宽基线、低纹理)。

局限与存疑

作者自己列了两条:一是整个监督来自 LightGlue 的匹配质量,碰到重复纹理、无纹理表面或重叠很少的宽基线就会失效;二是每场景几分钟的延迟离实时还远。读下来还有一点:对已经很强的模型增益有限,说明它更像给弱模型兜底,而非普遍放大器。梯度冲突 42.4% 这个比例也提示,如果换成更复杂的损失组合,解耦逻辑可能要重调。

术语

原文与代码

相关论文

全部论文解读