OneCanvas: Efficient 3D Scene Understanding via Panoramic Reprojection

rsasaki0109 · x · 2026-08-21

OneCanvas introduces a novel approach to 3D scene understanding for Vision-Language Models (VLMs) that avoids complex geometry encoders or high training costs. It aggregates patch features from multiple views onto a single equirectangular panoramic canvas. By unprojecting patches to 3D world coordinates using depth and pose, and adding 3D positional embeddings, OneCanvas maintains spatial context without rasterization, enabling efficient spatial reasoning across a unified coordinate system.

Original post →

More from Research

Research channel →