前沿 VLM 拼图几何推理集体崩溃,新基准揭示能力悬崖
kwangmoo_yi · x · 2026-08-01
新论文提出 JigShape 基准,通过带有卡扣结构的拼图(避免纹理重复导致的歧义)来测试视觉语言模型(VLM)的视觉几何推理能力。
测试结果暴露了当前模型的严重缺陷:
- 零样本表现极差:在 9.5 万个测试样本中,除 GPT-5.5 在 4x4 拼图上略高于随机猜测外,其他前沿模型全军覆没。
- 遭遇扩展性悬崖:尽管微调能让模型在 4x4 拼图上达到 97% 以上的准确率,但随着拼图块数量增加(如 8x8 或 12x12),所有模型表现均迅速崩溃至近乎随机。
这表明当前模型架构在处理大量约束条件时,无法保持一致的逻辑满足能力。
所属事件:新基准 JigShape 揭示视觉语言模型几何推理缺陷(2 条相关)→
「研究」频道最新
- OpenAI 用自我博弈训练红队 Agent,防御注入攻击提升至 95.9% — alex_verem · 2026-08-01
- 研究者探讨训练优化致大模型自创“承重 Token”现象 — tokenbender · 2026-08-01
- 机器人化身科学家:LabEvolver 让实验成功率升至 91% — imjustnewatai · 2026-08-01
- 困扰学者两年的数学猜想,AI 数分钟写出严谨证明 — abeirami · 2026-08-01
- 开发者开源 Bug 搜寻基准:实测大模型查 Bug 能力 — PawelHuryn · 2026-08-01
- AI 制药瓶颈在数据而非模型,行业预期将迎转折 — MatthewMcAteer0 · 2026-08-01