VLM 模态 Gap 全解析:成因、高维几何与特性之辩
@gabriberton 于 08-19 发布多节科普线程,系统讲解视觉语言模型(VLM)中的「模态 Gap」现象:图像与文本嵌入在共享空间中各自聚集成簇,中间保持一段距离。
已确认
- 成因方面:在双 Transformer 的 CLIP 架构中,对比学习拉近正样本对、推开负样本对,但每个样本会推开除配对外的所有其他样本,推开的力量往往过强,导致理论预期应闭合的模态 Gap 在实践中无法闭合。
- 现象在随机初始化的 Transformer 中就已出现:图像嵌入往往聚集在一起,模态 Gap 部分源于模型初始化。
- NeurIPS 2022 论文《Mind the Gap》系统分析了该现象,并发现闭合 Gap 有助于提高零样本分类性能。
为什么重要
- 作者提出 Gap 可能并非缺陷而是有益特性:超球面嵌入空间通常约 1000 维,Gap 可能仅存在于其中一个维度上;在其余大部分维度中,跨模态正样本(文本与对应图像)实际彼此接近,这解释了为什么 text-to-image 等跨模态检索效果依然很好。
- 这一视角对理解与改进 CLIP 类多模态模型的几何结构、以及对「是否应强行闭合 Gap」的设计取舍具有参考价值。
2026-08-19 ~ 2026-08-19 · 7 条相关
一手来源
- 深入解析 VLM 模态 Gap 与对比学习机制 — gabriberton ·
- CLIP 训练为何无法消除模态间隔?多模态几何现象揭秘 — gabriberton ·
- NeurIPS 论文解读:模态间隔是缺陷还是特性? — gabriberton ·
- 【源头】深入解析 VLM 模态 Gap 与对比学习机制 — gabriberton · 2026-08-19
- 【源头】CLIP 训练为何无法消除模态间隔?多模态几何现象揭秘 — gabriberton · 2026-08-19
- 为何 CLIP 训练难以闭合多模态模型的模态 Gap — gabriberton · 2026-08-19
- 高维空间下的真相:跨模态检索为何依然有效 — gabriberton · 2026-08-19
- CLIP 跨模态检索为何有效:正样本在高维空间彼此靠近 — gabriberton · 2026-08-19
- 模态 Gap 是缺陷还是特性?高维空间下的启示 — gabriberton · 2026-08-19
- 【源头】NeurIPS 论文解读:模态间隔是缺陷还是特性? — gabriberton · 2026-08-19