为何 CLIP 训练难以闭合多模态模型的模态 Gap

gabriberton · x · 2026-08-19

探讨模态 Gap 的成因。在使用两个 Transformer(分别处理图像和文本)的 CLIP 架构中,虽然训练目标是拉近正样本对,但实践中推开负样本的力量往往过强(每个样本会推开除配对外的所有其他样本),导致模态 Gap 无法闭合。这一现象在“Mind the Gap”论文中被研究,并存在于许多多模态模型中。

所属事件:VLM 模态 Gap 全解析:成因、高维几何与特性之辩(7 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →