OneCanvas 用一张全景图让 2D 图像模型学会 3D 空间推理
NeurIPS 2026 Spotlight 论文 OneCanvas 提出简化路径:将多相机视角的房间视频帧或 patch 特征汇聚到一张全景画布上,让普通预训练 2D 视觉语言模型无需专用几何编码器或巨大训练预算,即可直接理解 3D 场景并回答空间问题。该方法在空间推理基准上取得新 SOTA,登顶榜单,展示了用极简数据组织方式扩展 2D 模型 3D 能力的可能性。
2026-10-04 ~ 2026-10-06 · 2 条相关
- OneCanvas 把多相机视图拼成全景画布,让 2D VLM 直接理解 3D 场景 — anselm · 2026-10-04
- OneCanvas:一张图让普通图像模型学会3D空间推理,登顶SOTA — Roger_M_Taylor · 2026-10-06