新基准 VDiff-Bench:1756 题暴露前沿模型找不同能力短板
yixin_wan_ · x · 2026-09-10
作者提出 VDiff-Bench,一个细粒度图像差异识别基准:1756 道四选一题目,覆盖位置、运动、颜色、噪声/分辨率、纹理、OCR 文字、光照等 10 类变化,并用基于真值构造的干扰项增加难度。
对 11 个开源与闭源 MLLM 的测试显示,细粒度视觉对比仍然脆弱:
- 三个 7-8B 开源模型在语义变化上得分 52.5-70.6%
- 但在噪声、纹理等低层变化上仅得 8.7-33.3%,常常误判为「没有变化」
- 不同模型呈现不同的失败模式
论文已发布 arXiv(2609.06245),数据集上线 Hugging Face。与 OpenAI 求解千禧年数学难题等前沿科学进展形成反差:模型能做前沿科研,却在儿童找不同游戏上不可靠。
「模型」频道最新
- 开发者推测 OpenAI agent 或经用户聊天记录「找到」解决方案 — smolix · 2026-09-10
- 网友实测 DeepSeek 4.1 Flash:写游戏有玩家品味,天生爱快 — teortaxesTex · 2026-09-10
- 两周内 Meta 在 OpenCode 的 token 份额从 3.5% 暴涨至 45.4% — armand_ruiz · 2026-09-10
- Apex 复盘 NanoChat:峰值内存降至 140.6GB,指标之外被忽视的细节 — eyishazyer · 2026-09-10
- 数学家亲述:半年内 AI 从产出垃圾到几小时完成我数月的证明 — RexDouglass · 2026-09-10
- 开发者再议 OpenAI 争议:训练完全可以定向优化前沿研究能力 — ctjlewis · 2026-09-10