多模态模型 3D 计数准确率仅 17.7%,NVIDIA 发布 Spatial-IQ 基准

NVIDIAAI · x · 2026-08-01

NVIDIA Research 联合耶鲁大学发布了 Spatial-IQ 基准测试,用于评估多模态大语言模型(MLLM)的 3D 空间认知能力。

测试将 3D 物体计数拆解为 9 个层次化的感知与认知子任务(如计算列数、层数以及推断隐藏的支撑块)。实验发现,人类在该测试中的准确率高达 82.1%,而当前最好的现成多模态模型仅为 17.7%。

研究表明,模型在计数时缺乏人类具备的层次化分解能力。通过在 Spatial-IQ 数据集上进行微调,并引入针对该层次结构的思维链(CoT)监督,可以有效提升模型的空间推理表现。

所属事件:英伟达联合耶鲁推出 Spatial-IQ 基准(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →