Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction
Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu, Ning Guo, Mu Xu, Hang Zhang, Ming Qian
cs.CV
2026-08-27
阿里AMAP的ABot-Recon只看当前帧加前11帧KV,预测当前相机系点图和相邻相对位姿再递推全局。Oxford Spires上ATE 4.35米、RPE-R 0.12°,相对此前最好结果约降40%;H100上24.45 FPS、6.71 GB。
从几万帧视频在线恢复相机轨迹和稠密几何,内存和单帧算力必须封顶。早期流式模型用有限上下文或循环状态做到因果、恒定开销,但序列一长就漂。最近 LingBot-Map、HorizonStream 把短程观察和持久长程记忆拼在一起,把「怎么管历史状态」做成了架构中心。
阿里 AMAP 这条路反过来:学到的时序状态严格局部,预测目标跟总长度无关。只要每步估计的是「当前相机坐标系里的点图」和「跟上一帧的相对位姿」,训练可以在短 clip 上完成,推理可以接到上万帧。全局轨迹是相对变换链式相乘,回归目标不会随着离第一帧越来越远而变难。
ABot-Recon 从 π³ 权重初始化,改成因果流式。每来一帧,图像编码器出 patch token,加上可学习的相机 token,在 12 帧窗口里做帧内注意力和窗口因果跨帧注意力。几何头输出当前相机系的点图和置信度;相邻两帧的相机 token 拼成成对描述子,预测相对变换 T{i-1←i}。窗口外的 KV 丢掉,时序存储 O(K),注意力 O(NK)。
相对位姿一帧帧乘下去,旋转误差会指数放大。补了两刀,都不加长上下文。
旋转精修器只改旋转、平移不动。运动证据来自位姿描述子,视觉证据用粗粒度帧描述去查询稠密 token,两者融合后送进门控时序卷积,在最近 K 帧上预测轴角残差,再复合到初始相对旋转上。整个模块 4.75M 参数,约占全模型 0.48%。
监督也不只盯相邻帧。窗口内所有间隔不超过 K-1 的帧对,都把链式复合位姿跟真值比,间隔越长权重越大(指数 γ 取在 0 到 1 之间)。模型在训练时就看见「连乘之后错了多少」。外加点图、法向、置信度损失,以及残差平滑项。
训练分两阶段:Stage I 用 32 帧 clip 训 32K 步,先稳住局部几何和相邻运动;Stage II 把 clip 拉到 128 帧再训 38K 步,并打开旋转精修器。最后冻住主干,只校准置信度 4K 步。数据是 30 个合成加真实集合,采样比约 62% / 38%。推理可选接与训练无关的回环后端:DINOv2-SALAD 检索重访帧,再把相对约束丢进位姿图。
三条长程轨迹基准,全部 stride=1,Sim(3) 对齐后算 ATE / RPE。ATE 是整条轨迹的绝对位置 RMSE,RPE 是相对位姿误差。
| 方法 | KITTI ATE (m) | Oxford ATE (m) | Oxford RPE-R (°) | VBR ATE (m) |
| HorizonStream | 22.51 | 8.81 | 0.20 | 29.02 |
| LingBot-Map | 29.13 | 7.32 | 2.29 | 29.45 |
| ABot-Recon | 18.25 | 4.35 | 0.12 | 30.14 |
| +回环 | 13.49 | 4.02 | 0.12 | 9.99 |
Oxford 上 ATE 和 RPE-R 相对此前流式最好结果约降 40%。VBR 无回环时 ATE 略差于 HorizonStream(30.14 对比 29.02),加上回环则到 9.99,低于 HorizonStream 的 17.64。H100 上跑 KITTI-02:24.45 FPS、6.71 GB;HorizonStream 帧级模式 8.02 FPS / 13.04 GB。
稠密重建在 Oxford Spires(阈值 4 m)上 Chamfer 1.37、F1 91.81,优于 LingBot-Map 的 1.68 / 90.58。室内 7Scenes 和 TUM-Dynamic 上不占优:7Scenes F1 94.88,低于 LingBot-Map 的 96.01 和 HorizonStream 的 98.22。
消融看 ATE。仅相邻监督的 32 帧基线在 KITTI / Oxford / VBR 为 56.60 / 10.16 / 52.90;加上复合损失 27.66 / 9.40 / 44.72;128 帧训练 22.31 / 5.95 / 36.77;再加旋转精修器 18.25 / 4.35 / 30.14。长 clip 这一步在三个集上分别再降 19.3%、36.7%、17.8%;精修器再降 18.2%、26.9%、18.0%。
流式三维重建最近的默认叙事是「必须有长程记忆」。这篇用 12 帧 KV 在公里级驾驶和地标尺度上把轨迹误差压下去,说明瓶颈经常是预测参数化,不一定是缓存不够。对要在车上或机器人上跑在线重建的人,恒定显存加可插拔回环,比把层级记忆焊进网络更干净。室内短场景里持久几何上下文仍然有用,这篇自己也承认,别拿它去换掉所有 SLAM。
讨论里写了:紧凑室内、频繁重访的场景上,重建不是全面最好,因为方法故意不保留场景级状态。动态物体的专门处理、外部记忆、更大规模预训练都列为后续。
几个数字也要看清楚。VBR 无回环时全局 ATE 并没有赢 HorizonStream,「局部上下文就够」主要成立在 Oxford 和 KITTI。DPVO、DPV-SLAM 在 Oxford 上 ATE 更低(1.56 / 2.95),但它们要相机内参,ABot-Recon 只吃 RGB;拿掉这个前提,优化式方法仍可能更准。训练用了内部合成和内部真实数据,权重比例写了,数据本身不可复现。旋转精修器只修旋转,快速纯平移或尺度漂移不在它的射程里。回环用的是现成检索加位姿图,增益很大,说明纯局部链式仍会漂,只是漂得比旧流式模型慢。