为何 CLIP 训练难以闭合多模态模型的模态 Gap
gabriberton · x · 2026-08-19
探讨模态 Gap 的成因。在使用两个 Transformer(分别处理图像和文本)的 CLIP 架构中,虽然训练目标是拉近正样本对,但实践中推开负样本的力量往往过强(每个样本会推开除配对外的所有其他样本),导致模态 Gap 无法闭合。这一现象在“Mind the Gap”论文中被研究,并存在于许多多模态模型中。
所属事件:VLM 模态 Gap 全解析:成因、高维几何与特性之辩(7 条相关)→
「多模态」频道最新
- Seedance 2.5 生成 30 秒 1080p 视频,一致性大幅提升 — SimplyAnnisa · 2026-08-20
- R2V 类参考技术或让 LoRA 与 Civitai 逐步过时 — Suibeam · 2026-08-20
- 实测 400+ 条视频:MiniMax H3 换角色编辑提示词攻略 — Darqsat · 2026-08-20
- Midjourney 立体感 Jennifer Lawrence 提示词分享 — michaelrabone · 2026-08-20
- 微软 MAI-Image-2.5-Pro 登顶图像编辑榜 — ArtificialAnlys · 2026-08-20
- 用户实测 MiniMax H3:视觉与提示词遵循开源最强,短板在物理与音质 — SensitiveUse7864 · 2026-08-20