OneCanvas:全景重投影实现高效 3D 场景理解
rsasaki0109 · x · 2026-08-21
OneCanvas 是一种新的视觉语言模型(VLM)3D 场景理解方法。它摒弃了复杂的特定几何编码器或昂贵的训练预算,而是将所有视角的补丁特征聚合到一个单一的等距柱状全景画布上。具体做法是利用深度和相机姿态将补丁反投影到 3D 世界坐标,并放置在画布对应的连续经纬度上。该方法不进行光栅化或跨视图聚合,通过添加补丁度量坐标的 3D 位置嵌入来恢复深度信息,从而让所有帧共享一个空间坐标系。
「研究」频道最新
- 新方法 Chain-of-Experience 实现持续 LLM 改进 — UCSC-VLAA · 2026-08-21
- SONIC 新版机器人 checkpoint 开源,腕部精细操作精度大增 — zhengyiluo · 2026-08-21
- 中港团队开源 Libra,智能体训练吞吐提升 3 倍 — jiqizhixin · 2026-08-21
- 模型评测深坑解析:Prompt、参数与引擎如何影响分数 — rsasaki0109 · 2026-08-21
- CMU 等联合发布 DelusionEval:揭示 LLM 强化幻觉与安全随长度退化 — burkov · 2026-08-21
- 预训练还有巨大优化空间,算力是唯一瓶颈 — zeeshanp_ · 2026-08-21