AutoCompass: Accurate Visual Localization on Public Maps by Learning from Weak Labels
Javier Tirado-Garín, Alan Savio Paul, Shuai Chen, Axel Barroso-Laguna, Tommaso Cavallari, Daniyar Turmukhambetov, Victor Adrian Prisacariu, Eric Brachmann
ECCV 2026
cs.CV
2026-09-03
AutoCompass用原始GPS邻域和SfM相对位姿训练神经地图匹配,不要朝向标签。KITTI上DINOv2加相对位姿的横向R@1达70.8%,超过强监督OrienterNet的48.7%。
神经地图匹配把地面图像的鸟瞰特征跟 OpenStreetMap 一类二维地图做互相关,估计平面位置和朝向。地图免费、体积大约 200 KB / 128×128 m,比建城市场景的三维地图便宜。训练却要大规模带绝对位姿的图像。这些标签通常由 SfM 簇再跟 GPS 融合得到,系统偏差消不掉,人行道上的图会被标进楼里。强监督会把这些错误学进去。
骨干仍是 OrienterNet:图像出 BEV 特征,地图出特征,离散位姿体积 S×S×N(默认 128 m 边长)上 softmax。改的是损失。
朝向标签可以不要。在真值位置上把朝向边缘化,只最大化该格子的位置概率。BEV 与地图的几何归纳偏置会自己把朝向推出来,单张透视图像就够,不需要 360° 全景。
GPS 当弱位置:在 GPS 周围 ±r 的邻域里对位置和朝向一起边缘化,最大化这块的概率质量。r 在 5–20 m 之间不敏感,覆盖常见消费级 GPS 误差。模型被鼓励把质量放在邻域内某处,精确落点交给匹配归纳偏置。
有相对位姿时再加两项。两张图各自预测绝对位姿分布,相对旋转是朝向分布的循环互相关,相对平移是位置分布的二维互相关,在 SfM 给出的相对量上做 NLL。这对共享的平移、旋转偏移不变,正好克制伪真值整体偏了几米的情况。相对平移若还不在地图坐标系里,可以改监督距离范数,半箱宽 5 m。训练对来自同一 SfM 簇、基线小于 100 m 的图像对采样。
训练用 Mapillary Geo-Localization 里仍能拿到的 11 座城市。KITTI Test2 有 RTK 真值。
| 方法(OSM,11 城) | 横向 R@1 | 纵向 R@1 | 朝向 R@1 |
| OrienterNet ResNet-101 | 37.7 | 17.6 | 15.7 |
| AutoCompass 原始 GPS | 43.1 | 26.8 | 21.1 |
| AutoCompass 相对位姿 | 56.6 | 33.2 | 28.9 |
| 同上 + DINOv2 | 70.8 | 34.1 | 37.9 |
原始 GPS、没有朝向,已经超过用优化后 3-DoF 标签重训的 OrienterNet。相对位姿再拉开一截,并超过 12 城预训练的 OSMLoc。
第一人称序列 LaMAria(苏黎世,厘米级控制点)和 Oxford Day-and-Night 上同样成立。LaMAria 单帧、DINOv2、相对位姿:位置 R@1 20.9%,OrienterNet 同骨干 9.1%;融 50 帧后 R@1 86.2% 对 57.5%,并且在严格阈值上超过 GPS。GPS 有偏,多帧融合帮不上忙。特征可视化里,强监督学出糊的大楼块,弱监督钉在墙角一类细关键点。
大规模地图像匹配的瓶颈是标签,不是网络。朝向可以从匹配结构里长出来,GPS 当邻域而不是点监督,相对位姿比「优化过的绝对位姿」更干净。损失与架构无关,OrienterNet 和 DINOv2 都能接。做城市 AR 或车载定位、只有消费级 GPS 和一段 SLAM 时,这条监督路径比继续打磨伪真值更划算。单帧在宽阈值上仍接近 GPS,优势要靠序列融合才稳。
仍要粗 GPS 来裁地图瓦片,完全没有位置先验时走不通。相对平移损失默认瓦片原点已经地理参考;只有任意坐标系时退化为距离损失,信息更弱。朝向涌现绑在 BEV-地图互相关这条结构上,换回归头可能失效。Oxford 的地理参考本身有米级偏差,评测做了逐序列对齐。LaMAria 人工去掉了盯地面的控制点帧,协议带一点人工。MGL 缺了阿姆斯特丹,和 12 城预训练权重的对比并不完全公平,论文为此重训了 11 城基线。