Doomed to Re-Annotate, Forever: The ImageNet Story
Illia Volkov, Nikita Kisel, Tetiana Mishkina, Klara Janouskova, Jiri Matas
cs.CV
2026-08-14
捷克理工vis组从零重标ImageNet-1k全部5万张验证图:约12%原标签错、33.3%本该多标签。新标签下MLLM准度涨5–6点,最强监督模型几乎不动。
ImageNet-1k 验证集的 top-1 准确率,到今天仍是视觉识别论文里最常报的一个数字。这套 2012 年的标签一直很脏:漏标、错标、近义类重叠、训练/验证分布漂移,前人已经反复写过。社区也做过几次验证集重标,Beyer 等人的 ImageNet ReaL、Shankar 等人的多标签标注、Tsipras 等人的子集重标,都往前走了一步,但都沿用原来那套有问题的 WordNet 分类体系,彼此对不上。
标签噪声会改模型名次,下游该选谁跟着晃。布拉格捷克理工大学 vis 组这次把 5 万张验证图从零重标,产出 ReImageNet:多标签、边界框、按真实图内容改过的类定义,外加 rendition、reflection、text-recognition、crowd、dominant 五类语义属性。
核心改动是把「单标签分类」改写成「把人第一眼就能看见的 ImageNet 类物体都标出来,并画框」。最初他们想标图里每一个可见物体,结果几十像素、靠上下文才能认出来的小东西,让标签集取决于标注员愿意放大到什么程度。后来改成至少标出人 5 秒内注意到的物体。
流程分几层:
先前一篇 case study 里,GPT-4o 跟人工标不一致的难例上,标注员大约一半承认自己错了或吸收了模型预测,另一半坚持且是对的。单靠众包一次性做完走不通;人加 MLLM 加专用工具,才是目前这个规模的质量上限。
按新标签,5 万张里约 12% 原 ImageNet 标签是错的:单标签不一致 5.5%、多标签不一致 2.8%、图里没有任何 ImageNet 类 3.8%。33.3% 是多标签图。先前重标的多标签率最高 21.6%(Tsipras 等),ReaL 只有 14.9%。
评测用宽松的 ReaL 准确率:预测落在任一合法标签里就算对,近义类(laptop 与 notebook computer)合并。剔除无有效类的 48114 张上,新标签对比原标签:
| 模型 | 原标签 | ReImageNet | 涨幅 |
| GPT-5.4 | 72.54 | 77.64 | +5.10 |
| Qwen3-VL | 70.95 | 77.04 | +6.09 |
| Gemma 4 | 69.48 | 74.87 | +5.39 |
| SigLIP2-g | 86.74 | 88.99 | +2.25 |
| DINOv3 | 86.49 | 87.69 | +1.20 |
| EVA-02 | 91.33 | 91.38 | +0.05 |
越不靠 ImageNet 监督信号的模型,对标签质量越敏感。监督最强的 EVA-02 几乎不动。原标签和重标不一致的难例子集上,所有模型准确率掉到 29–46%。
属性切片把模型家族切开。风格化的 rendition 图让所有模型掉点,监督模型最惨(EffNetV2 −9.8 点,DINOv3 −7.3 点),MLLM 只掉 1.3–2.3 点。要靠读图里文字才能认的 text-recognition,Qwen3-VL 反而涨 15.6 点,EffNetV2 掉 6.7 点。语言对齐让模型能把可见文字当识别线索,纯视觉监督模型没有这条路。
他们还切了 96051 个紧框作物,平均只占原图面积 33%。监督模型在「所有作物」设定下掉得最狠:EVA-02 −33.5 点,DINOv3 −32.3 点,Gemma 4 只掉 15.7 点。扩成互不重叠、只含一个物体的 ExCrops(38628 张,平均面积 82%)能挽回大约 10 个点。监督 ImageNet 模型吃的是整图上下文,对抠出来的物体并不熟。大约 10% 的图上,模型认不对最大物体,却认对了更小、不那么显眼的那一个。标准的中心裁剪评测,在这里站不住。
衍生集更糟。用 GPT-5.4 和 SigLIP2-g 意见一致的子集估误差下界,ImageNet-A 的估误差是原验证集同类子集的 5.8 倍;ImageNet-Sketch 估有 2861 张标错。问题是结构性的,不是这一套验证集独有。
如果还在用 ImageNet top-1 排模型,这个数字比看起来更松。对 MLLM 尤其松:新标签一次抬 5–6 个点,很大一块「错误」其实是标签没跟上模型已经认对的物体。监督模型涨得少,因为它们就是在这套脏标签上训出来的,跟噪声对齐了。
标注、类定义、指南和分析代码都公开了。想做检测、计数、按属性切片,这套框比单标签有用;想严格单标签对照,用 ExCrops,不要拿多标签 ReaL 跟过去十年的 top-1 比。
一次性众包、指南写死、多数投票,在细粒度语义上打不过一个受过训的标注员。现代 MLLM 评测如果还在用同一套流程,或者让被测模型自己标自己的题,噪声会再长一代。
作者自己列得很清楚。标注员都是欧洲背景,对 abaya 这类文化对象只能网上自学;野生动物细分类是非专家在标,连领域专家都容易搞错;共享类定义表保证一致,定义写错会整类传染;模型提示匿名了,仍可能把标注往模型预测上推。只覆盖验证集,类名是按验证图内容改的,训练/验证有分布漂移,未必适合训练集。图还是 2012 年的。
核验还没做完。第二轮才把 MLLM 加 SAM3 用上,作者说只预期小改动,但 12%、33.3% 这些数字在核验结束前不是终值。
另外两处站得不稳。一是用两个模型意见一致来估衍生集误差下界,前提是模型在 ImageNet 和衍生集上行为一致,这本身可能不成立;用模型一致定义标签质量,也会把当前架构的归纳偏置写进真值。二是多标签评估是宽松的:图里有多个合法标签,预测任意一个都算对,所以 ReGT 准确率天然高于单标签协议。论文用 ExCrops 补了一刀,主表的 +5–6 点不能直接读成「模型变强了」。
ImageNet 本身的问题类别和图像来源,这次重标没有碰。