ImageNet验证集约12%标签错了,重标后MLLM准度涨5–6点

Doomed to Re-Annotate, Forever: The ImageNet Story

Illia Volkov, Nikita Kisel, Tetiana Mishkina, Klara Janouskova, Jiri Matas

cs.CV

2026-08-14

捷克理工vis组从零重标ImageNet-1k全部5万张验证图:约12%原标签错、33.3%本该多标签。新标签下MLLM准度涨5–6点,最强监督模型几乎不动。

这篇在解决什么

ImageNet-1k 验证集的 top-1 准确率,到今天仍是视觉识别论文里最常报的一个数字。这套 2012 年的标签一直很脏:漏标、错标、近义类重叠、训练/验证分布漂移,前人已经反复写过。社区也做过几次验证集重标,Beyer 等人的 ImageNet ReaL、Shankar 等人的多标签标注、Tsipras 等人的子集重标,都往前走了一步,但都沿用原来那套有问题的 WordNet 分类体系,彼此对不上。

标签噪声会改模型名次,下游该选谁跟着晃。布拉格捷克理工大学 vis 组这次把 5 万张验证图从零重标,产出 ReImageNet:多标签、边界框、按真实图内容改过的类定义,外加 rendition、reflection、text-recognition、crowd、dominant 五类语义属性。

方法

核心改动是把「单标签分类」改写成「把人第一眼就能看见的 ImageNet 类物体都标出来,并画框」。最初他们想标图里每一个可见物体,结果几十像素、靠上下文才能认出来的小东西,让标签集取决于标注员愿意放大到什么程度。后来改成至少标出人 5 秒内注意到的物体。

流程分几层:

先前一篇 case study 里,GPT-4o 跟人工标不一致的难例上,标注员大约一半承认自己错了或吸收了模型预测,另一半坚持且是对的。单靠众包一次性做完走不通;人加 MLLM 加专用工具,才是目前这个规模的质量上限。

结果

按新标签,5 万张里约 12% 原 ImageNet 标签是错的:单标签不一致 5.5%、多标签不一致 2.8%、图里没有任何 ImageNet 类 3.8%。33.3% 是多标签图。先前重标的多标签率最高 21.6%(Tsipras 等),ReaL 只有 14.9%。

评测用宽松的 ReaL 准确率:预测落在任一合法标签里就算对,近义类(laptop 与 notebook computer)合并。剔除无有效类的 48114 张上,新标签对比原标签:

模型原标签ReImageNet涨幅
GPT-5.472.5477.64+5.10
Qwen3-VL70.9577.04+6.09
Gemma 469.4874.87+5.39
SigLIP2-g86.7488.99+2.25
DINOv386.4987.69+1.20
EVA-0291.3391.38+0.05

越不靠 ImageNet 监督信号的模型,对标签质量越敏感。监督最强的 EVA-02 几乎不动。原标签和重标不一致的难例子集上,所有模型准确率掉到 29–46%。

属性切片把模型家族切开。风格化的 rendition 图让所有模型掉点,监督模型最惨(EffNetV2 −9.8 点,DINOv3 −7.3 点),MLLM 只掉 1.3–2.3 点。要靠读图里文字才能认的 text-recognition,Qwen3-VL 反而涨 15.6 点,EffNetV2 掉 6.7 点。语言对齐让模型能把可见文字当识别线索,纯视觉监督模型没有这条路。

他们还切了 96051 个紧框作物,平均只占原图面积 33%。监督模型在「所有作物」设定下掉得最狠:EVA-02 −33.5 点,DINOv3 −32.3 点,Gemma 4 只掉 15.7 点。扩成互不重叠、只含一个物体的 ExCrops(38628 张,平均面积 82%)能挽回大约 10 个点。监督 ImageNet 模型吃的是整图上下文,对抠出来的物体并不熟。大约 10% 的图上,模型认不对最大物体,却认对了更小、不那么显眼的那一个。标准的中心裁剪评测,在这里站不住。

衍生集更糟。用 GPT-5.4 和 SigLIP2-g 意见一致的子集估误差下界,ImageNet-A 的估误差是原验证集同类子集的 5.8 倍;ImageNet-Sketch 估有 2861 张标错。问题是结构性的,不是这一套验证集独有。

为什么重要

如果还在用 ImageNet top-1 排模型,这个数字比看起来更松。对 MLLM 尤其松:新标签一次抬 5–6 个点,很大一块「错误」其实是标签没跟上模型已经认对的物体。监督模型涨得少,因为它们就是在这套脏标签上训出来的,跟噪声对齐了。

标注、类定义、指南和分析代码都公开了。想做检测、计数、按属性切片,这套框比单标签有用;想严格单标签对照,用 ExCrops,不要拿多标签 ReaL 跟过去十年的 top-1 比。

一次性众包、指南写死、多数投票,在细粒度语义上打不过一个受过训的标注员。现代 MLLM 评测如果还在用同一套流程,或者让被测模型自己标自己的题,噪声会再长一代。

局限与存疑

作者自己列得很清楚。标注员都是欧洲背景,对 abaya 这类文化对象只能网上自学;野生动物细分类是非专家在标,连领域专家都容易搞错;共享类定义表保证一致,定义写错会整类传染;模型提示匿名了,仍可能把标注往模型预测上推。只覆盖验证集,类名是按验证图内容改的,训练/验证有分布漂移,未必适合训练集。图还是 2012 年的。

核验还没做完。第二轮才把 MLLM 加 SAM3 用上,作者说只预期小改动,但 12%、33.3% 这些数字在核验结束前不是终值。

另外两处站得不稳。一是用两个模型意见一致来估衍生集误差下界,前提是模型在 ImageNet 和衍生集上行为一致,这本身可能不成立;用模型一致定义标签质量,也会把当前架构的归纳偏置写进真值。二是多标签评估是宽松的:图里有多个合法标签,预测任意一个都算对,所以 ReGT 准确率天然高于单标签协议。论文用 ExCrops 补了一刀,主表的 +5–6 点不能直接读成「模型变强了」。

ImageNet 本身的问题类别和图像来源,这次重标没有碰。

术语

原文与代码

社区讨论

相关论文

全部论文解读