训练 30 个 CLIP 模型验证:视觉塔越大不一定越好

KevinKaichuang · x · 2026-09-09

Samir Char 及合作者发布一项系统性研究:视觉-文本编码器的算力分配比例通常是 CLIP 训练中未经审视的设计选择。团队独立缩放两个编码器、共训练 30 个 CLIP 模型,并在 40 个数据集上评估下游性能,结论是「更大的 CLIP 不一定更好」——两塔的平衡比例比单纯的规模更关键。该长帖以线程形式展开,为多模态预训练的算力分配提供了实证依据。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →