高德发布 ABot-Recon:仅靠 12 帧局部上下文实现流式长视频 3D 重建

rsasaki0109 · x · 2026-10-02

ABot-Recon 是高德视觉实验室(amap-cvlab)提出的纯视频输入流式 3D 重建方法,对应论文《Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction》。核心思路是不依赖持久化 learned 长程记忆,而是用固定 12 帧的局部上下文,把当前帧几何与相邻帧相对位姿组合进全局重建,从而处理任意长的视频流。已开源(GitHub 1.1k star),附技术报告,9 月底已在 train 分支放出微调代码,含 18 个数据源、混训/EMA/验证/断点续训等配置。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →