ICLR 论文:CLIP 的 OOD 泛化并非靠「训练集撞题」,25% 数据即可达标

HildeKuehne · x · 2026-09-20

Hilde Kuehne 在讨论「涌现现象是否被高估」时引用了一篇 ICLR 2024 论文《Does CLIP's generalization performance mainly stem from high train-test similarity?》,称视觉语言模型常在测试集相似数据上训练,也解释了视频任务表现不佳——可爬取的视频基准测试数据不够。

论文本身做了对照实验:CLIP 的 OOD 泛化长期被归因于 LAION 等大规模训练集与 ImageNet 时代基准存在高相似度。作者在「剪枝后复现 ImageNet 训练-测试相似度」的 LAION 子集上重训 CLIP,发现部分基准成绩下降,但整体 OOD 表现依然很高——说明高相似度不足以解释泛化能力,训练数据其他属性才是关键。

附带发现:剪掉与 OOD 基准不相似的样本后,仅用 1 亿样本(约 LAION 原始大小的 1/4)就能训出与原版相当的 OOD 成绩。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →