深入解析 VLM 模态 Gap 与对比学习机制

gabriberton · x · 2026-08-19

解释视觉语言模型(VLM)中的模态 Gap 现象。在随机初始化的 Transformer 中,图像嵌入往往聚集在一起。CLIP 训练试图拉近正样本对、推开负样本对,但在实践中,推开的力量可能过强,导致模态 Gap 无法闭合,这种现象在多模态模型中普遍存在。

所属事件:VLM 模态 Gap 全解析:成因、高维几何与特性之辩(7 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →