DatBench: Discriminative, Faithful, and Efficient VLM Evaluations
DatologyAI, :, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Ricardo Monti, Aldo Carranza, Alex Fang, Alvin Deng, Amro Abbas, Brett Larsen, Cody Blakeney, Darren Teh, David Schwab, Fan Pan, Haakon Mongstad, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Kaleigh Mentzer, Luke Merrick, Parth Doshi, Paul Burstein, Pratyush Maini, Scott Loftin, Spandan Das, Tony Jiang, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt
cs.LG, cs.AI
2026-01-06
DatologyAI 清洗 33 个现有 VLM 榜,收成九项能力。去掉不看图可答和错标样本后,AI2D 从选择题 77.6% 掉到开放作答 40.5%,精选子集平均加速 13 倍、最高 50 倍。
视觉语言模型(VLM)的公开榜,分数和算力两笔账都在失真。选择题自带 1/N 的猜对概率,模型还能靠选项文本走捷径。通用能力里超过 70% 的样本不看图也能答对,VQA-v2 同样超过 70%。算力上,OLMo3 后训练阶段接近 20% 的预算花在评测。高分辨率图像加上思考链,单条可达上万 token;OCR 类常常超过 10 万条,思考链若超过 32K token,单评一项就可能生成超过 30 亿 token。
几个点的涨幅,在这层噪声上更像贴合了榜的怪癖。DatologyAI 把 33 个现有数据集当成待清洗数据,不另起一套题。三条标准:题必须真的用到视觉,并且接近实际用法;强弱模型要被拉开;花掉的计算要换成区分度。
九项能力:图表、文档、自然场景文字、数学与逻辑、空间、定位(grounding,按文字框出区域)、计数、图示与表格、通用视觉问答。筛题和打分用 27 个 1B–10B 模型,含 Qwen3-VL、InternVL 各代、GLM-4.1V、R-4B、Gemma-3。生成上限 4096 token。
四步只动数据。
选择题改成开放作答,选项删除,Qwen3-30B 做语义判断。必须留着选项的题(「下列哪一项」)用循环评测:选项轮换多遍,每遍都对才得分。
盲答过滤把图像拿掉,27 个模型只读文本。开放题阈值 τ=1,有一个模型不看图答对就丢。选择题和计数题答案空间小,阈值放宽。盲答主要是三类:常识(蚊子四个阶段)、刻板印象(马桶多为白色)、纯算术(1 到 30 里数字 2 出现几次)。
错标和糊图分两段。先收集 27 个模型全部答错的题,再请 GPT-5.2 对照标准答案复核。含糊、标错、或分辨率低到目标认不出的,删除。样本有富余,宁可误删少量真难题。
区分度用点双列相关 rpb,不调参:这题的对错是否跟着模型总分走。强模型稳对、弱模型稳错的优先留下;rpb 为负的丢到队尾。27 个模型撑不起稳定的 IRT(用很多受试者拟合每题的难度和区分度),所以用这个替代。子集另留至多 20% 给裁判认可、但这些模型都不会的前沿题。
DatBench 是这四步之后的小子集,给训练循环。DatBench-Full 停在第三步。计数和空间上两者大小接近,其余能力 Full 最大约 50 倍。
格式一换,分数就掉。循环评测相对普通选择题斜率大于 1,普通格式常靠猜测送出 20%–30% 的底分,稳定正确率仍低于 50%。
| 处理 | 基线 | 结果 |
| AI2D 改开放作答 | 选择题均分 77.56% | 40.53%,最强模型少将近 35 分 |
| 通用能力去掉盲答 | 原榜挤在 65%–80% | 删掉 72.07% 文本可解样本后,分数散到 10%–65%,区间约扩至 4 倍 |
| 空间质量过滤 | 原样本 | 含糊或分辨率不足占 42.07%;ChartQA Pro 删 17.2%,MMMU-Pro 删 24.3%;定位与通用的质量过滤不到 1% |
| 按 rpb 保留约 40% | 随机保留同样比例 | 约 90% 总区分度;同预算随机抽样的信号不到其一半 |
| 发布的 DatBench | 过滤后全量 | 平均加速 13 倍,最高约 50 倍 |
图表和通用问答的 Pearson 相关 r=0.90,数学和通用问答 r=0.76。定位对文档 r=−0.29,对文字识别 r=−0.19,数学对空间推理 r=−0.19。层次聚类把图表、数学、通用分成一团,文字识别、空间、图示分成另一团。
GLM-4.1V-9B 偏感知:图示 66.4%,空间 36.8%,数学 17.4%。Qwen3-VL-4B 比较均衡,文档 71.0%,文字识别 77.9%,推理 59.9%。R-4B 数学最高,43.4%,空间最低,11.4%。
思考版会先写一段推理再作答。增益按(思考准确率−指令准确率)/指令准确率计算。数学约 +36.8%,图表约 +10.8%,文字识别约 −53.5%,文档约 −47.8%。想对大约 425 token,想错大约 1196.9 token,后者约为不思考模型的 14 倍。
看图减去只看文本,计数的视觉增量 60.2%,定位 42.3%,数学 13.0%,空间推理 14.9%。数学高分里有一块是语言模型在猜。
训练循环用 DatBench,出报告用 Full。13 倍是九项平均;计数和空间删完后两套规模接近,加速有限。图表和定位几乎贴着对角线,排序还在。通用和文档斜率更陡,原先挤在一起的模型被拉开。
推理题加 token 有赚,文字和文档上是亏的,错的时候更贵。以识别为主的路径,不该默认打开思考。
分数下降来自拿走猜对、盲答和错标。题面没有换成一套新定义。
rpb 估自 1B–10B、输出上限 4096 token。论文写明,模型更大或思考更长时,高区分题会换一批。拿这套子集量前沿大模型,区分度没有保证。
选样没有多样性约束。高相关又近重复的题,子集可能收成一簇。源数据是否够杂,没有检验。
全员答错再交 GPT-5.2,真难题和坏标签在同一个篮子里。论文承认裁判会把成立的专门推理当成脏数据,过滤偏保守。空间题丢掉 42.07% 之后,剩余部分还像不像真实的空间理解,没有人类复标来估误删率。
1B 和 8B 差距大,随机子集也能保住粗排序。rpb 仍只拟合这 27 个模型,没见过的结构没有留出数字。Qwen3-30B 判开放答案,GPT-5.2 判标签,两者一致率也没有报告。