多模态模型 3D 计数准确率仅 17.7%,NVIDIA 发布 Spatial-IQ 基准
NVIDIAAI · x · 2026-08-01
NVIDIA Research 联合耶鲁大学发布了 Spatial-IQ 基准测试,用于评估多模态大语言模型(MLLM)的 3D 空间认知能力。
测试将 3D 物体计数拆解为 9 个层次化的感知与认知子任务(如计算列数、层数以及推断隐藏的支撑块)。实验发现,人类在该测试中的准确率高达 82.1%,而当前最好的现成多模态模型仅为 17.7%。
研究表明,模型在计数时缺乏人类具备的层次化分解能力。通过在 Spatial-IQ 数据集上进行微调,并引入针对该层次结构的思维链(CoT)监督,可以有效提升模型的空间推理表现。
所属事件:英伟达联合耶鲁推出 Spatial-IQ 基准(2 条相关)→
「模型」频道最新
- Fable 游戏 AI 安全过滤器频繁误杀,被指严重影响体验 — dreamwieber · 2026-08-01
- DeepSeek-V4-Flash 推理受阻:vLLM 暂不支持新 confidence_head — teortaxesTex · 2026-08-01
- KOL称若无开源模型,闭源AI月费恐高达2000美元 — iamaliveix · 2026-08-01
- 会计任务大考:58%难题无模型能解,Claude居首 — EdwardSun0909 · 2026-08-01
- 实测 GPT-5.6 Luna:知识工作表现比肩 Sol,成本大幅降低 — BenBajarin · 2026-08-01
- OpenAI 宣布大降价:GPT-5.6 Terra 与 Luna 限时半价 — LeTanLoc98 · 2026-08-01