OneCanvas 把多相机视图拼成全景画布,让 2D VLM 直接理解 3D 场景
anselm · x · 2026-10-04
VLM 做 3D 场景理解通常依赖复杂的专用几何编码器或巨大的训练预算。OneCanvas 提出更简单的路线:把所有相机视角的 patch 特征汇聚到一张全景画布上,让预训练 2D VLM 像读普通图像一样处理。
画布可以以任意位姿为中心,因此同一表示还能支持特定视角下的情境推理——这对机器人和具身 AI 的应用很关键。
「具身」频道最新
- Runway 发布开源权重世界动作模型 Praxis-1,视频预训练转机器人控制 — CyberRobooo · 2026-10-04
- Polymarket 开新盘:押注 Muse 何时登上 Meta 眼镜 — Polymarket · 2026-10-04
- 机器人无需接触即可钻穿坚硬岩石,非接触挖掘技术引关注 — TinfoilTricorn · 2026-10-04
- 为多 Agent 会话打造实体控制台:LCD+物理按键切换会话 — Weak_Cherry_4878 · 2026-10-04
- 前沿VLM连“转头找物体”都做不好,论文揭示主动视觉搜索短板 — _vztu · 2026-10-04
- NYU 推出 5 美元开源磁触觉传感器 eFlesh,3D 打印即可自制 — lukas_m_ziegler · 2026-10-04