前沿 VLM 连拼图都拼不好?JigShape 基准直击视觉几何软肋

_vztu · x · 2026-08-04

研究指出,虽然训练模型玩拼图能显著提升其目标检测、领域泛化和 3D 理解能力,但当前的主流前沿视觉语言模型(VLM)在拼图任务上表现糟糕。

团队推出了 JigShape 基准测试,专用于评估 VLM 的视觉几何推理能力。与以往将图像切成可互换矩形的测试不同,JigShape 采用真正的互锁拼图块(带有凸起和凹槽),确保每块的位置具有唯一性,从而避免了传统测试中因空白区域互换导致的误判。该项目同步开源了包含 18.6 万条数据的训练集。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →