阿里ABot-Recon只缓存12帧做超长流式三维重建,牛津轨迹误差降约40%

Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction

Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu, Ning Guo, Mu Xu, Hang Zhang, Ming Qian

cs.CV

2026-08-27

阿里AMAP的ABot-Recon只看当前帧加前11帧KV,预测当前相机系点图和相邻相对位姿再递推全局。Oxford Spires上ATE 4.35米、RPE-R 0.12°,相对此前最好结果约降40%;H100上24.45 FPS、6.71 GB。

这篇在解决什么

从几万帧视频在线恢复相机轨迹和稠密几何,内存和单帧算力必须封顶。早期流式模型用有限上下文或循环状态做到因果、恒定开销,但序列一长就漂。最近 LingBot-Map、HorizonStream 把短程观察和持久长程记忆拼在一起,把「怎么管历史状态」做成了架构中心。

阿里 AMAP 这条路反过来:学到的时序状态严格局部,预测目标跟总长度无关。只要每步估计的是「当前相机坐标系里的点图」和「跟上一帧的相对位姿」,训练可以在短 clip 上完成,推理可以接到上万帧。全局轨迹是相对变换链式相乘,回归目标不会随着离第一帧越来越远而变难。

方法

ABot-Recon 从 π³ 权重初始化,改成因果流式。每来一帧,图像编码器出 patch token,加上可学习的相机 token,在 12 帧窗口里做帧内注意力和窗口因果跨帧注意力。几何头输出当前相机系的点图和置信度;相邻两帧的相机 token 拼成成对描述子,预测相对变换 T{i-1←i}。窗口外的 KV 丢掉,时序存储 O(K),注意力 O(NK)。

相对位姿一帧帧乘下去,旋转误差会指数放大。补了两刀,都不加长上下文。

旋转精修器只改旋转、平移不动。运动证据来自位姿描述子,视觉证据用粗粒度帧描述去查询稠密 token,两者融合后送进门控时序卷积,在最近 K 帧上预测轴角残差,再复合到初始相对旋转上。整个模块 4.75M 参数,约占全模型 0.48%。

监督也不只盯相邻帧。窗口内所有间隔不超过 K-1 的帧对,都把链式复合位姿跟真值比,间隔越长权重越大(指数 γ 取在 0 到 1 之间)。模型在训练时就看见「连乘之后错了多少」。外加点图、法向、置信度损失,以及残差平滑项。

训练分两阶段:Stage I 用 32 帧 clip 训 32K 步,先稳住局部几何和相邻运动;Stage II 把 clip 拉到 128 帧再训 38K 步,并打开旋转精修器。最后冻住主干,只校准置信度 4K 步。数据是 30 个合成加真实集合,采样比约 62% / 38%。推理可选接与训练无关的回环后端:DINOv2-SALAD 检索重访帧,再把相对约束丢进位姿图。

结果

三条长程轨迹基准,全部 stride=1,Sim(3) 对齐后算 ATE / RPE。ATE 是整条轨迹的绝对位置 RMSE,RPE 是相对位姿误差。

方法KITTI ATE (m)Oxford ATE (m)Oxford RPE-R (°)VBR ATE (m)
HorizonStream22.518.810.2029.02
LingBot-Map29.137.322.2929.45
ABot-Recon18.254.350.1230.14
+回环13.494.020.129.99

Oxford 上 ATE 和 RPE-R 相对此前流式最好结果约降 40%。VBR 无回环时 ATE 略差于 HorizonStream(30.14 对比 29.02),加上回环则到 9.99,低于 HorizonStream 的 17.64。H100 上跑 KITTI-02:24.45 FPS、6.71 GB;HorizonStream 帧级模式 8.02 FPS / 13.04 GB。

稠密重建在 Oxford Spires(阈值 4 m)上 Chamfer 1.37、F1 91.81,优于 LingBot-Map 的 1.68 / 90.58。室内 7Scenes 和 TUM-Dynamic 上不占优:7Scenes F1 94.88,低于 LingBot-Map 的 96.01 和 HorizonStream 的 98.22。

消融看 ATE。仅相邻监督的 32 帧基线在 KITTI / Oxford / VBR 为 56.60 / 10.16 / 52.90;加上复合损失 27.66 / 9.40 / 44.72;128 帧训练 22.31 / 5.95 / 36.77;再加旋转精修器 18.25 / 4.35 / 30.14。长 clip 这一步在三个集上分别再降 19.3%、36.7%、17.8%;精修器再降 18.2%、26.9%、18.0%。

为什么重要

流式三维重建最近的默认叙事是「必须有长程记忆」。这篇用 12 帧 KV 在公里级驾驶和地标尺度上把轨迹误差压下去,说明瓶颈经常是预测参数化,不一定是缓存不够。对要在车上或机器人上跑在线重建的人,恒定显存加可插拔回环,比把层级记忆焊进网络更干净。室内短场景里持久几何上下文仍然有用,这篇自己也承认,别拿它去换掉所有 SLAM。

局限与存疑

讨论里写了:紧凑室内、频繁重访的场景上,重建不是全面最好,因为方法故意不保留场景级状态。动态物体的专门处理、外部记忆、更大规模预训练都列为后续。

几个数字也要看清楚。VBR 无回环时全局 ATE 并没有赢 HorizonStream,「局部上下文就够」主要成立在 Oxford 和 KITTI。DPVO、DPV-SLAM 在 Oxford 上 ATE 更低(1.56 / 2.95),但它们要相机内参,ABot-Recon 只吃 RGB;拿掉这个前提,优化式方法仍可能更准。训练用了内部合成和内部真实数据,权重比例写了,数据本身不可复现。旋转精修器只修旋转,快速纯平移或尺度漂移不在它的射程里。回环用的是现成检索加位姿图,增益很大,说明纯局部链式仍会漂,只是漂得比旧流式模型慢。

术语

原文与代码

社区讨论

相关论文

全部论文解读