前沿 VLM 连拼图都拼不好?JigShape 基准直击视觉几何软肋
_vztu · x · 2026-08-04
研究指出,虽然训练模型玩拼图能显著提升其目标检测、领域泛化和 3D 理解能力,但当前的主流前沿视觉语言模型(VLM)在拼图任务上表现糟糕。
团队推出了 JigShape 基准测试,专用于评估 VLM 的视觉几何推理能力。与以往将图像切成可互换矩形的测试不同,JigShape 采用真正的互锁拼图块(带有凸起和凹槽),确保每块的位置具有唯一性,从而避免了传统测试中因空白区域互换导致的误判。该项目同步开源了包含 18.6 万条数据的训练集。
「研究」频道最新
- DAPD 论文:解决大模型蒸馏中的信息不对称问题 — _akhaliq · 2026-08-05
- 剪枝注意力层,机器人动作专家 FLOPs 降 94% — mathildepapillo · 2026-08-05
- 用 Silico 平台探究 VLM 医疗影像识别能力 — mathildepapillo · 2026-08-05
- Goodfire 推出 Silico 可解释性工具,月费 1000 美元面向研究人员 — deedydas · 2026-08-05
- 可解释性分析优化机器人模型,算力骤降 40% — mathildepapillo · 2026-08-05
- 探究 VLA 模型中 VLM 与动作专家的信息交互 — mathildepapillo · 2026-08-05