OneCanvas:全景重投影实现高效 3D 场景理解

rsasaki0109 · x · 2026-08-21

OneCanvas 是一种新的视觉语言模型(VLM)3D 场景理解方法。它摒弃了复杂的特定几何编码器或昂贵的训练预算,而是将所有视角的补丁特征聚合到一个单一的等距柱状全景画布上。具体做法是利用深度和相机姿态将补丁反投影到 3D 世界坐标,并放置在画布对应的连续经纬度上。该方法不进行光栅化或跨视图聚合,通过添加补丁度量坐标的 3D 位置嵌入来恢复深度信息,从而让所有帧共享一个空间坐标系。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →