OneCanvas 把多相机视图拼成全景画布,让 2D VLM 直接理解 3D 场景

anselm · x · 2026-10-04

VLM 做 3D 场景理解通常依赖复杂的专用几何编码器或巨大的训练预算。OneCanvas 提出更简单的路线:把所有相机视角的 patch 特征汇聚到一张全景画布上,让预训练 2D VLM 像读普通图像一样处理。

画布可以以任意位姿为中心,因此同一表示还能支持特定视角下的情境推理——这对机器人和具身 AI 的应用很关键。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →