新基准 JigShape 揭示视觉语言模型几何推理缺陷

一项名为 JigShape 的最新研究通过带有卡扣结构的拼图游戏,对当前主流视觉语言模型(VLM)的视觉几何推理能力进行了测试。测试结果暴露了这些前沿模型的严重缺陷:在 8x8 拼图任务中,模型的准确率几乎等同于随机猜测。这表明当前 VLM 在复杂的视觉几何推理方面仍存在巨大的能力悬崖。

2026-08-01 ~ 2026-08-01 · 2 条相关