UCSD 与 Lambda 提出 CVP,3D 空间推理五项基准全面超越 Video-3D-LLM

TheZachMueller · x · 2026-09-25

Lambda 博客介绍了 UC San Diego 与 Lambda 合作、入选 WACV 2026 的 CVP 方法,解决 3D 视觉语言模型在空间指代上张冠李戴的问题(如把 tray rack 认成缝纫机)。

核心做法:

对比 Video-3D-LLM 的成绩:SQA3D EM 从 58.6 升至 62.3,Scan2Cap CIDEr 从 83.8 升至 90.5,在 ScanQA、SQA3D、ScanRefer、Multi3DRefer、Scan2Cap 全部五项基准上均有提升。文章背景指出,物理 AI 需要的不只是语言与 2D 视觉识别,而是对 3D 场景中物体关系的真正推理。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →