高德发布 ABot-Recon:仅靠 12 帧局部上下文实现流式长视频 3D 重建
rsasaki0109 · x · 2026-10-02
ABot-Recon 是高德视觉实验室(amap-cvlab)提出的纯视频输入流式 3D 重建方法,对应论文《Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction》。核心思路是不依赖持久化 learned 长程记忆,而是用固定 12 帧的局部上下文,把当前帧几何与相邻帧相对位姿组合进全局重建,从而处理任意长的视频流。已开源(GitHub 1.1k star),附技术报告,9 月底已在 train 分支放出微调代码,含 18 个数据源、混训/EMA/验证/断点续训等配置。
「研究」频道最新
- Climate Change AI 上线项目目录,收录 100+ 气候 AI 项目 — anselm · 2026-10-02
- 南大 OneStreamer:4B 模型刷新全部八项流式视频理解基准 — NJU · 2026-10-02
- AgSpec 用检索式投机解码为编码 Agent 提速最高 4.76 倍 — Sumin Lee · 2026-10-02
- VTR-Bench 揭视频生成短板:11 个模型渲染文字最好的词错率仍 0.25 — Yu Huang · 2026-10-02
- E-MoE 用专家路由作共享隐变量,改进少步扩散语言模型生成 — Arseny Ivanov · 2026-10-02
- PyRUA-Lean 让 GPT-6 Astra 机器人 Agent 成功率升 14%、token 省 65% — DAGroup-PKU · 2026-10-02