MIT 提出 DAAAM:利用视觉大模型实时构建 3D 动态场景图
tom_doerr · x · 2026-08-11
MIT 提出了名为 DAAAM(Describe Anything, Anywhere, at Any Moment)的新方法,旨在为机器人提供实时、大规模的时空记忆能力。
核心技术:
- 该方法将 SAM 分割模型、BotSort 目标跟踪与视觉语言模型(VLM)的定位能力相结合。
- 将这些数据输入 Hydra 系统,从而实时构建出 3D 动态场景图。
主要贡献:
- 提出了一种基于优化的前端,用于从局部描述模型中提取语义信息。
- 实现了具有实时性能的分层 4D 场景图构建。
- 在 NaVQA 和 SG3D 基准测试中取得了 SOTA 表现。
「具身」频道最新
- 取代你的机器人可能很笨拙,但成本极低 — VraserX · 2026-08-11
- 机器人专家呼吁:云推理 200ms 延迟是致命伤,端侧部署不可替代 — vaibhavbetter · 2026-08-11
- 机器人VLA研究OAT入围顶会杰出论文,实测覆盖60+任务 — Haoyu_Xiong_ · 2026-08-11
- Robotaxi 颠覆网约车与汽车产业,成本将低于私家车 — mitchdeg · 2026-08-11
- 500美元机械臂让3D打印机实现全自动连续打印 — FinanceYF5 · 2026-08-11
- 阿里千问开放平台上线,支持 AI 眼镜端技能开发 — 千问APP · 2026-08-11