VLM 拼图测试翻车:8x8 拼图准确率几乎等同于随机

kwangmoo_yi · x · 2026-08-01

Li 等人发布了一项名为 JigShape 的新研究,旨在通过拼图游戏评估视觉语言模型(VLM)的视觉几何推理能力。

研究发现,VLM 在拼图任务上的表现不佳:

这暴露了当前 VLM 在空间与几何逻辑理解上的严重短板。

所属事件:新基准 JigShape 揭示视觉语言模型几何推理缺陷(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →