无标签不等于无人类监督,CVPR无监督标题从近4%掉到1%

Position: Unlabeled IS NOT Equal to No Human Supervision in Visual Learning

Dong Lao

ICML 2026

cs.CV, cs.LG

2026-09-03

扫CVPR等顶会发现无监督标题从近4%掉到约1%;LSU主张披露数据先验和预训练依赖,无标签不等于无人类监督。

这篇在解决什么

自监督预训练把视觉表征做成了基础设施。下游方法常常因为没用人工标注,就被写成「无监督」。这个说法在标签意义上成立,同时把一件更要紧的事盖住了:数据怎么筛、目标怎么设、backbone从哪来,里面已经嵌了大量人类先验。

LSU的Dong Lao写的这篇ICML 2026立场论文,判断很硬:没有标签,不等于没有人类监督。更早的无监督多半是域内的,用数字训练数字、用脸训练脸,分布假设局部可见。现在预训练跨域复用,那些假设跟着特征一起迁走,却很少被点名。

方法

这不是新算法。证据来自十年顶会统计,再配一张披露清单。

标题统计覆盖CVPR、ICCV、ECCV在2013–2025的主会论文,按标题是否含unsupervised或self-supervised计数,并排除unsupervised domain adaptation,因为分布偏移在那里本身就是研究对象。全文扫描覆盖2015–2025全部17435篇CVPR论文,用Qwen-2.5-32B-Instruct只记录作者写明的预训练依赖。对2020–2025标题含unsupervised的287篇CVPR论文,又做了人工核验:方法是否依赖论文贡献之外的预训练模型。自动分类相对人工标注精度91.5%、召回81.8%、准确率86.9%。

监督从两条缝进来。Google图片搜tiger和cup,不经人工过滤也是标准姿态、居中构图、杯子把手朝右,这是拍摄和检索习惯,不是算法涌现。对比学习默认「同一张图的两次增强是同一物体」,这在ImageNet这种物体居中的数据上靠得住,换到多物体场景或显微影像就容易失效。DINO系列在物体中心数据上随规模变好,掺进更泛的非物体中心图像后,ImageNet-1k线性探测反而下降。水平翻转做通用物体识别合理,做路牌识别会把语义翻反,不变性本身就是人写进去的判断。

建议是一张轻量清单,不惩罚用先验,只要求写清:用没用预训练、冻了哪些层、数据范围和过滤规则、增强不变性、评测有没有泄漏。另几条配套做法是:把依赖预训练的方法和从域内无标数据学的方法分开写;换对比、重建、多模态等不同预训练再测一遍;把放宽假设本身当成贡献;尽量在相近算力下比较。

结果

数字描述的是社区怎么说话,不是新SOTA。

信号峰值之后
CVPR标题含unsupervised2021年近4%2025年接近1%
CVPR全文提到无/自监督2021年22.17%(2015年为10.13%)2024年15.52%,2025年12.85%

标题带unsupervised的CVPR论文里,对外部预训练的依赖从2020年起持续上升,且集中在DINO、CLIP、MoCo、扩散模型和SwAV这几家。少数backbone家族吃掉大部分点名来源,下游所谓涌现性质,有可能只是共享的上游策展和归纳偏置。

三个假说并列,没有做因果识别:弱假设方法在同一把「无监督」尺子下显得更弱,堆数据和堆算力也比从零做新目标更立刻见效;预训练变成基础设施后,无监督不再被当成标题里的贡献;终端用户更在乎能不能接进流水线,不太在乎训法。

为什么重要

从业者每周都在冻DINO或CLIP,再把整条流水线叫做无监督分割、物体发现或对应。如果效果其实来自上游数据策展和对比学习对「物体」的假设,却被写成下游机制涌现,复现和跨域迁移都会踩坑。清单几乎零成本,却能让两篇都叫无监督的工作放到同一比较面上。

对算力不够的组更实在。如果无监督被默认同等于吃得起大backbone,域内、弱假设、运动或几何信号这类探索会越来越难发。把「把假设写清楚」和「把假设放宽」写成可发表的贡献,是在给这些工作留位置。

这是立场,不是新方法。它改的是怎么写、怎么比,不是立刻换掉预训练配方。

局限与存疑

标题统计本来就是粗信号,作者自己也承认。排除domain adaptation说得通,但会漏掉标题不写unsupervised、正文却在做无监督的工作;全文扫描用Qwen-2.5-32B,只认点名的预训练,漏检和误检都在。287篇人工标注只覆盖标题含unsupervised的子集,不能代表全部视觉论文。

三个假说没有因果检验。DINO在泛化数据上掉点,说明目标和数据先验会打架,图里没有给出可直接引用的绝对精度。清单会不会变成新的审查仪式、会不会被写成空话,没有验证。作者刻意不点名具体「无监督」论文,讨论更干净,读者也更难拿着清单去对某一篇算账。

术语

原文与代码

社区讨论

相关论文

全部论文解读