新基准 JigShape 揭示视觉语言模型几何推理缺陷
一项名为 JigShape 的最新研究通过带有卡扣结构的拼图游戏,对当前主流视觉语言模型(VLM)的视觉几何推理能力进行了测试。测试结果暴露了这些前沿模型的严重缺陷:在 8x8 拼图任务中,模型的准确率几乎等同于随机猜测。这表明当前 VLM 在复杂的视觉几何推理方面仍存在巨大的能力悬崖。
2026-08-01 ~ 2026-08-01 · 2 条相关
- VLM 拼图测试翻车:8x8 拼图准确率几乎等同于随机 — kwangmoo_yi · 2026-08-01
- 前沿 VLM 拼图几何推理集体崩溃,新基准揭示能力悬崖 — kwangmoo_yi · 2026-08-01