新基准 VDiff-Bench:1756 题暴露前沿模型找不同能力短板

yixin_wan_ · x · 2026-09-10

作者提出 VDiff-Bench,一个细粒度图像差异识别基准:1756 道四选一题目,覆盖位置、运动、颜色、噪声/分辨率、纹理、OCR 文字、光照等 10 类变化,并用基于真值构造的干扰项增加难度。

对 11 个开源与闭源 MLLM 的测试显示,细粒度视觉对比仍然脆弱:

论文已发布 arXiv(2609.06245),数据集上线 Hugging Face。与 OpenAI 求解千禧年数学难题等前沿科学进展形成反差:模型能做前沿科研,却在儿童找不同游戏上不可靠。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →