UCSD 与 Lambda 提出 CVP,3D 空间推理五项基准全面超越 Video-3D-LLM
TheZachMueller · x · 2026-09-25
Lambda 博客介绍了 UC San Diego 与 Lambda 合作、入选 WACV 2026 的 CVP 方法,解决 3D 视觉语言模型在空间指代上张冠李戴的问题(如把 tray rack 认成缝纫机)。
核心做法:
- 引入 target-affinity token,突出与任务相关的目标物体;
- 用 allocentric 网格编码全局空间上下文,采用中心/外围 token 划分。
对比 Video-3D-LLM 的成绩:SQA3D EM 从 58.6 升至 62.3,Scan2Cap CIDEr 从 83.8 升至 90.5,在 ScanQA、SQA3D、ScanRefer、Multi3DRefer、Scan2Cap 全部五项基准上均有提升。文章背景指出,物理 AI 需要的不只是语言与 2D 视觉识别,而是对 3D 场景中物体关系的真正推理。
「研究」频道最新
- 免校准量化方法 TQ 开源:4-bit 量化 Qwen3.8-27B 即发即用 — textclf · 2026-09-25
- Yoav Goldberg:LLM 推理链强得反常,难以解释其如何从 RL 中涌现 — yoavgo · 2026-09-25
- 12 周建成全 AI 运营实验室,C5 发布 SciUniverse 科学研究基准 — RazRazcle · 2026-09-25
- IDS 论文入选 NeurIPS Oral:代码与形式化证明协同演化,成功率 3 倍于 Claude Code — adityagp · 2026-09-25
- Astral Codex Ten 长文剖析「神经语递归」:OpenAI 首席科学家的解释能打几分 — Astral Codex Ten · 2026-09-25
- AI Agent 经济学论文:Agent 采购平均只选到第 5 顺位商品 — ghadfield · 2026-09-25