正常表面传感器仍胜多数三维模型,难场景才被反超

Pumpire: Unified Benchmark for Metric Distance Estimation

Siyu Chen, Zehan Wang, Jiayang Xu, Yihan Wu, Jialei Wang, Junming Chen, Ziang Zhang, Yutong Ying, Zhou Zhao

cs.CV

2026-10-09

100场共6400帧用卷尺标距,评了29组三维模型。正常表面传感器δ1.05为79.3%,最强估计模型仅31%。

这篇在解决什么

抓取和避障要的是两点相距多少米。深度榜和内参榜分开打分,点云看 Chamfer Distance 与 F1,空间问答停在物体级,这些都对不上两个像素反投影之后的米制距离。单图与多帧、只吃 RGB 的估计与再吃深度先验的补全,数据集也彼此拆开。Pumpire 用同一套点对距离协议把四类设定放在一起比。

方法

浙江大学等采集了 pumpire-6k:100 个真实场景,室内 40、室外 60。每场先拍 200 到 300 帧,再均匀留下 64 帧,合计 6400 帧,分辨率 1280×720,并带对齐的传感器深度和内参。真值不是深度图,是卷尺。每场只贴一对半径 10 mm 的圆点,全序列共用这一条中心距。像素从锚帧手点开始,用 CoTracker3 传到后续帧,再逐帧改到像素级。库里收了传感器容易失准的表面,类别可以重叠:透明 12 场、反光 10 场、重复纹理 13 场、无纹理 5 场、细结构 25 场、贴着锐边 11 场,普通表面仍是多数。

评测把两个标注像素按深度 D 和内参 K 反投影,距离取欧氏范数。估计模型用自己预测的内参,Metric3D 与 Metric3D v2 用它们定义深度时的 canonical 内参;条件于传感器深度的补全模型用真值内参。绝对误差 AE(米)、相对误差 RE、对数误差 LE、阈值精度 δ,以及预测距离的相对标准差 RSD,都先在一场的帧上平均,再对场景等权。难度直接借用传感器的跨帧波动:原始深度算出的点距 RSD 大于 0.1 算难场景,得到 24 场难、76 场正常。视频模型每场固定看 32 组、每组 10 帧。29 组配置都能出绝对尺度,图像估计 8 组、图像补全 10 组、视频估计 6 组、视频补全 5 组。

结果

正常表面的 RealSense D435 很强,难表面几乎不可用。100 场平均 AE 0.991 米,主要是 24 场难场景拉起来的。

方法正常场景难场景
D435 传感器AE 0.026 米,δ1.05 79.32%AE 4.047 米,RE 8.390
Metric3D v2AE 0.073 米,δ1.05 31.00%平均排名从 1.00 降到 4.00
Depth Anything 3AE 0.078 米,δ1.05 30.52%仍是第一,AE 0.167 米
Lingbot-DepthAE 0.022 米,δ1.05 84.52%δ1.05 降到 47.92%,排名仍第一
CAPA-VGGTAE 0.016 米,δ1.05 91.44%AE 2.352 米,δ1.05 31.48%

18 个图像配置里,正常表面接近或超过传感器 δ1.05 的只有五个补全模型:Lingbot-Depth、PriorDA、Omni-dc、LDCM、InfiniDepth。最好的图像估计停在 31.00%,不到 79.32% 的一半。难场景反过来,16 个配置的 RE 低于传感器的 8.390,图像估计的头名换成 Depth Pro。Depth Anything 3 在视频估计的两个子集都是第一,难场景 δ1.05 为 21.16%,和传感器的 21.03% 几乎一样,AE 却是 0.167 米对 4.047 米。视频补全的前三都是 CAPA;难场景上 CAPA-MoGe2 的 AE 为 2.351 米,略低于 CAPA-VGGT,阈值精度更高的是后者。

深度榜加内参榜预测不了点对距离。五个图像估计模型里,MoGe-2 的综合排名最好,为 1.92,到了 Pumpire 正常子集平均排名 4.71,输给 Unidepthv2 的 2.43。把预测内参换成真值内参再反投影,56 个模型–指标对里 47 个变差。深度图是和它自己的内参绑在一起的。

难场景 RE 除以正常场景 RE,估计模型大约 1 到 20 倍,补全模型大约 20 到 210 倍。补全的 δ1.05 更高,离群帧也更重;估计模型精度低一截,误差更有上界。图像补全随机喂 100、1000、10000 个深度点或整幅传感器深度,点变多并不单调变好。视频侧只有 MapAnything 和 pi3x 能按视角比例接收深度,占比从 0.1 增到 1.0 时两家 RE 都下降,MapAnything 降得更多。

按同一套多帧抽样对齐之后,正常子集上 Metric3D v2 的 RE/RSD 为 0.106/0.067,Depth Anything 3 为 0.109/0.029,Lingbot-Depth 为 0.030/0.035,CAPA-VGGT 为 0.023/0.028。多帧几乎没把 RE 再压低,主要把 RSD 从 0.067 拉到 0.029。深度先验两头都降。

为什么重要

选一个带尺度的三维模型做抓取或避障时,可以按表面状况分流。传感器可靠的普通表面,原始深度仍是强基线,纯 RGB 估计的 δ1.05 差着一倍以上,换一个更新的单目网络补不齐。透明、反光、细结构上,传感器会给出数米级的距离,学习模型更不容易跟着崩。要峰值精度就上补全,CAPA-VGGT 在正常子集把 δ1.05 做到 91.44%;在意最坏的那几帧,估计模型的误差倍数更可预期。深度点也不是越密越好,整幅深度会把噪声模式原样留下来。

这篇不提供新架构。它把米制点距从深度误差里拆出来,并说明原先的榜解释不了这件事。

局限与存疑

正文没有单独的局限章节,下面几条会改变数字的读法。

难场景的定义就是传感器 RSD 大于 0.1。学习模型在这 24 场上 RE 更低,说明它们没有跟着主动光在反光和细结构上一起崩,但划分本身就把传感器放在不利位置。不能把该子集当成一般意义的几何难题。

每场只有一对贴纸中心。贴纸半径 10 mm、对比度高,是为了远近都能点中。引言写的是任意点对,协议量的是一条固定弦长。几何在别处错了,只要这两点的距离接近卷尺,AE 和 δ 仍然好看。卷尺的重复测量误差、像素标注的偏差,正文都没有给数。

估计用预测内参,补全用真值内参,视频补全还每帧吃到传感器深度。CAPA-VGGT 的 91.44% 和 Metric3D v2 的 31.00% 不在同一输入条件下。100 场里难子集只有 24 场,平均排名对少数离群场景敏感,0.1 也是经验阈值。相对深度模型被排除在外,要先自行恢复尺度才能进这套协议。

术语

原文与代码

相关论文

全部论文解读