VLM 拼图测试翻车:8x8 拼图准确率几乎等同于随机
kwangmoo_yi · x · 2026-08-01
Li 等人发布了一项名为 JigShape 的新研究,旨在通过拼图游戏评估视觉语言模型(VLM)的视觉几何推理能力。
研究发现,VLM 在拼图任务上的表现不佳:
- 在 8x8 尺寸的拼图测试中,模型的表现几乎与随机抽取无异。
- 即便是相对简单的 4x4 拼图,大多数模型也难以准确完成。
这暴露了当前 VLM 在空间与几何逻辑理解上的严重短板。
所属事件:新基准 JigShape 揭示视觉语言模型几何推理缺陷(2 条相关)→
「研究」频道最新
- 重整化群理论解释大模型涌现与泛化机制 — burny_tech · 2026-08-01
- 数学家呼吁拒收大模型生成的猜想证明 — miniapeur · 2026-08-01
- eNTK 理论从 BERT 时代走向现代 LLM 预训练,前沿实验室已采用 — prfsanjeevarora · 2026-08-01
- DeepMind与Anthropic共探具身推理,通用大模型尚难独立控躯干 — RanjayKrishna · 2026-08-01
- USearchMolecules 升级 3D 分子数据集,加速药物发现 — srchvrs · 2026-08-01
- 英伟达提出 Spatial-IQ 基准,揭示多模态模型空间推理缺陷 — NVIDIAAI · 2026-08-01