零真实图蒸馏四教师,IDeaL 1K张反超ImageNet

IDeaL: Data-Free Multi-Teacher Distillation via Improved Dead Leaves

Feyza Yavuz, Mert Bülent Sarıyıldız, Diane Larlus

ECCV 2026

cs.CV

2026-08-25

用四教师注意力优化Dead Leaves,1M张把ImageNet从66.9%拉到78.2%,1K反超真图。

这篇在解决什么

多教师蒸馏想把几个视觉骨干的长处压进一个学生里。UNIC、RADIO、DUNE这类方法都默认手头有大量真图:教师自己的训练集,或者DataComp-1B这种网页图库。基础模型越来越多训在不能外发的私有数据上,这条假设正在失效。

NAVER LABS Europe这篇ECCV 2026把问题推到极端:一张真图都不给,多教师蒸馏还能走多远。前人用Stable Diffusion按ImageNet类别生成过替代图,这里连生成模型都不靠,只用程序噪声,再按教师注意力把噪声优化成更适合蒸馏的样本。

方法

蒸馏框架直接复用UNIC。四个教师都是ViT-B/16,全在ImageNet上训过:自监督的DINO、iBOT,有监督的DeiT-3,以及为分类微调过的dBOT-ft。学生同样是ViT-B/16,对齐每个教师的CLS和patch特征。教师数据一致,后面看到的差距才能算到蒸馏数据头上。

先拿三种程序数据硬替ImageNet:高斯噪声、FractalDB、Dead Leaves。Dead Leaves是一套公式画出来的重叠色块,统计上接近自然图的功率谱,但不含语义。它明显强过另外两种,但和真图仍有缺口。

IDeaL从Dead Leaves出发,把像素当可学习参数,梯度穿过冻结的教师,用两项去相关损失改图:

两项损失对四个教师求和。生成和蒸馏拆开:图先优化完存盘,再当普通训练集用。不需要类别标签,也不需要分类头,自监督教师也能进组。实现上,250张一组,每次抽40张优化10步,每组共4000步,Adam,学习率0.1。

结果

1M张规模下,IDeaL学生ImageNet top-1 78.2%,Dead Leaves是66.9%,完整ImageNet蒸馏的UNIC上界是83.2%。15个迁移分类平均70.6%(Dead Leaves 65.5%,真图73.1%),ADE20K mIoU 34.5%(29.1% / 39.0%),NYUd深度RMSE 0.573(0.632 / 0.531)。相对Dead Leaves,四项大约提升17%、8%、18%、9%。除了ImageNet分类以78.2%略低于最弱教师DINO的78.4%,迁移、分割、深度都超过了最弱教师。

1K预算下,分类任务上IDeaL反超1K张ImageNet子集:ImageNet 74.1%对72.6%,迁移68.6%对65.3%。分割和深度仍是真图略好(mIoU 33.9对34.2,RMSE 0.594对0.566)。换ViT-S/16学生,1K IDeaL四项全过1K ImageNet。

四个教师联合优化明显好过各优化再拼接:10K设置下ImageNet 77.0%对75.1%。消融里patch去相关是主力,image去相关是补丁,两项一起最好。

合成数据的老问题还在:从10K加到1M,IDeaL几乎不涨,真图继续涨。程序噪声过了小预算就不跟规模走。

为什么重要

这是目前把真图从多教师蒸馏里彻底拿掉、还能在分类和稠密任务上保持能看的一次受控实验。对拿不到教师训练集、又不能把私有图发出去的团队,1K到10K张优化噪声已经比随机抽1K张ImageNet更划算。生成一次可以复用到不同学生结构,ViT-S的实验支持这一点。

它还不是可以替换RADIO那种十亿图蒸馏的方案。四个教师都只见过ImageNet,和把CLIP、SigLIP那种私有数据教师蒸下来不是同一件事。

局限与存疑

作者没写独立的局限节,数字自己把边界画出来了。IDeaL不随数据量扩展,100K和1M几乎持平,真图从10K到1M仍有明显收益。实验锁在UNIC的四教师、同架构、全ImageNet设定里,没测过异构分辨率、不同预训练数据的教师。优化目标只用注意力表征的余弦去相关,没有重建、没有类别条件,生成图看起来也不像自然照片。这是设计如此,但也意味着学生从未在「像真图」的输入上对齐教师。深度任务上1K预算仍输给真图,论文摘要里「match or surpass」主要指分类。

术语

原文与代码

社区讨论

相关论文

全部论文解读