ICLR 论文:CLIP 的 OOD 泛化并非靠「训练集撞题」,25% 数据即可达标
HildeKuehne · x · 2026-09-20
Hilde Kuehne 在讨论「涌现现象是否被高估」时引用了一篇 ICLR 2024 论文《Does CLIP's generalization performance mainly stem from high train-test similarity?》,称视觉语言模型常在测试集相似数据上训练,也解释了视频任务表现不佳——可爬取的视频基准测试数据不够。
论文本身做了对照实验:CLIP 的 OOD 泛化长期被归因于 LAION 等大规模训练集与 ImageNet 时代基准存在高相似度。作者在「剪枝后复现 ImageNet 训练-测试相似度」的 LAION 子集上重训 CLIP,发现部分基准成绩下降,但整体 OOD 表现依然很高——说明高相似度不足以解释泛化能力,训练数据其他属性才是关键。
附带发现:剪掉与 OOD 基准不相似的样本后,仅用 1 亿样本(约 LAION 原始大小的 1/4)就能训出与原版相当的 OOD 成绩。
「研究」频道最新
- ZGCM-1 中文数据集登 HF 趋势,规模 1B-10B — zgcagi · 2026-09-20
- Gary Marcus 反驳 LLM「痛感方向」论文:语言聚类不等于会痛 — anilkseth · 2026-09-20
- MatSemNet 用 LLM 读 700+ 篇论文,把反应路径当序列加速催化剂发现 — bravo_abad · 2026-09-20
- 《模拟人生》Smart Zoi 用微调 1B 小模型驱动 50 个 AI NPC 实时决策 — Kangwook_Lee · 2026-09-20
- LlamaIndex 实测 100+ 模型文档解析,发布 ParseBench 评测集 — solyarisoftware · 2026-09-20
- ICLR 投稿量创纪录,作者收到的期刊邀稿邮件也创纪录 — wandedob · 2026-09-20