英伟达提出 Spatial-IQ 基准,揭示多模态模型空间推理缺陷
NVIDIAAI · x · 2026-08-01
英伟达研究团队推出了 Spatial-IQ,一个专门用于评估 3D 空间推理能力的诊断基准。测试表明,人类在图像物体计数(含遮挡)上准确率达 82.1%,而当前最强的多模态模型仅有 17.7%。该基准将空间推理拆解为 9 个子任务,通过针对性训练,研究成功将 Qwen2.5-VL-32B 的计数准确率从 2.9% 大幅提升至 62.6%。
所属事件:英伟达联合耶鲁推出 Spatial-IQ 基准(2 条相关)→
「模型」频道最新
- Fable 游戏 AI 安全过滤器频繁误杀,被指严重影响体验 — dreamwieber · 2026-08-01
- DeepSeek-V4-Flash 推理受阻:vLLM 暂不支持新 confidence_head — teortaxesTex · 2026-08-01
- KOL称若无开源模型,闭源AI月费恐高达2000美元 — iamaliveix · 2026-08-01
- 会计任务大考:58%难题无模型能解,Claude居首 — EdwardSun0909 · 2026-08-01
- 实测 GPT-5.6 Luna:知识工作表现比肩 Sol,成本大幅降低 — BenBajarin · 2026-08-01
- OpenAI 宣布大降价:GPT-5.6 Terra 与 Luna 限时半价 — LeTanLoc98 · 2026-08-01