VI3用板载IMU给冻结3D基础模型补上米制尺度

VI3: Grounding Pretrained 3D Foundation Models with Inertial Cues

Ernesto Lozano, Alberto Jaenal, Javier Civera

cs.CV

2026-09-03

VI3只用板载IMU、不用任何真值,给冻结的三维基础模型补上米制尺度。TartanAirV2里VGGT的轨迹尺度从0.14拉到1.05,相机平移误差从1.130米降到0.358米。

这篇在解决什么

DUSt3R、VGGT、π³ 这类 3D 基础模型(3DFM)能从无位姿多视图一次前向给出稠密深度和相机。监督多半来自 SfM,单目尺度不可观,输出只在未知全局尺度下正确。学出来的「度量」头或条件 token 吃的是训练分布里的尺度,换场景就会漂。IMU 在手机和飞行器上几乎标配,能直接看见带尺度的运动。

方法

VI3 不改预训练权重的训练目标,只在推理时用一段短视频加 IMU。先用 3DFM 的相对旋转闭式估计陀螺偏置;加速度偏置在短窗口里当作零。重力用 GeoCalib 的视觉估计、加速度平均、以及运动学最小二乘三个种子做共识:两者固定点方向差大约 1° 就算对齐,视觉重力偏离超过 20° 就丢掉,改走纯惯性固定点。尺度和初速度由 3DFM 速度增量与预积分速度增量的总体最小二乘给出,初速度大小再取各帧反投的中位数。

得到米制目标轨迹之后有两条注入路径。模型若接受位姿条件(Pi3X、Depth Anything 3),直接把预积分轨迹喂进去。否则做测试时细化(TTR):解冻相机头、深度头、聚合器最后 8 个跨帧注意力块,外加一个全局尺度标量 α,用相邻帧位姿损失、跨视图深度一致、以及钉住第一帧和零样本深度形状的锚,跑 160 步。α 同时乘平移和深度,旋转和内参不动。

结果

评测是每条序列抽 3 段、每段 8 帧、步长 2,指标不对齐轨迹,直接看绝对米制误差。数据集覆盖 TartanAirV2(合成)、EuRoC、UZH-FPV(高速竞速)。

数据 / 模型平移 RMSE Base→TTR (m)轨迹尺度 Base→TTR
TartanAirV2 / VGGT1.130 → 0.3580.14 → 1.05
EuRoC / VGGT0.192 → 0.0610.27 → 0.98
UZH-FPV / VGGT1.109 → 0.4970.22 → 0.81

无尺度模型原本大约小 3–7 倍,δ<1.25 接近 0;TTR 之后深度尺度靠近 1,TartanAirV2 上 VGGT 的 δ<1.25 从 0 到 0.515。旋转也降:同一设置 0.933° 到 0.410°。已自称度量的 Pi3X / DA3,在分布内的 TartanAirV2 上条件注入帮助有限,数据先验会盖过输入;EuRoC 和 UZH-FPV 上 TTR 仍把轨迹尺度往 1 拉,UZH-FPV 上 Pi3X 平移从 0.576 m 到 0.368 m。

无真值初始化:TartanAirV2 / EuRoC 重力误差约 1.05° / 1.08°,UZH-FPV 因高速升到 6.61°。EuRoC 陀螺偏置相对误差 11.3%。对初始化最敏感的是初速度大小,重力与偏置噪声要温和得多。RTX 5090 上初始化约 232 ms,TTR 总时间 VGGT-Ω 48 s、DA3 128 s。

为什么重要

这是给现成 3DFM 接物理尺度的推理期插件,不用重训、不用建图后端。无人机和手持设备本来就有 IMU,却很少用来校正前馈重建。TTR 比「把度量位姿当条件」更抗分布外:条件路径上先验会盖住输入,细化则改权重去贴这段惯性轨迹。运动条件好时它是微调,视差不足时它是强先验。

局限与存疑

尺度只在平移视差足够时能观,这是视觉惯性的硬边界,不是估计算法能绕开的。短窗口假定偏置恒定、加速度偏置为零,长序列要切段。评测全是航空平台、8 帧窗口,地面慢速或近似纯旋转没有数字。TartanAirV2 在多数骨干的训练集里(VGGT 除外),那一组更接近分布内修补。TTR 每段几十到一百秒,还不是在线 SLAM。

术语

原文与代码

社区讨论

相关论文

全部论文解读