英伟达联合耶鲁推出 Spatial-IQ 基准

英伟达联合耶鲁大学推出了 Spatial-IQ 基准测试,专门用于评估多模态大语言模型的 3D 空间认知与推理能力。测试结果显示,当前最强模型在 3D 物体计数(含遮挡)任务上的准确率仅为 17.7%,而人类准确率高达 82.1%。这凸显了现有模型在空间推理方面存在严重缺陷。

2026-08-01 ~ 2026-08-01 · 2 条相关