训练 30 个 CLIP 模型验证:视觉塔越大不一定越好
KevinKaichuang · x · 2026-09-09
Samir Char 及合作者发布一项系统性研究:视觉-文本编码器的算力分配比例通常是 CLIP 训练中未经审视的设计选择。团队独立缩放两个编码器、共训练 30 个 CLIP 模型,并在 40 个数据集上评估下游性能,结论是「更大的 CLIP 不一定更好」——两塔的平衡比例比单纯的规模更关键。该长帖以线程形式展开,为多模态预训练的算力分配提供了实证依据。
「研究」频道最新
- EMNLP 新论文用受控养育实验拆解二语者为何误判 "X laughed Y" — EliasEskin · 2026-09-10
- Greg Kamradt 检查 gamedevbench 任务:平均需改 4.7 个文件 114 行代码 — GregKamradt · 2026-09-10
- 前 Continue 创始人发表《超暗工厂》:预测 2029 年月均 35T agent tokens — tylerjdunn · 2026-09-10
- 100 个 AI agent 做数学题实验:9% 作弊后,24% 同伴选择揭发 — weballergy · 2026-09-10
- 科学成像 × 机器学习研讨会 2027 年波多黎各举办,申请已开放 — prof_kamilov · 2026-09-10
- 给果蝇大脑模型“切除”单个神经元,它开始认错情绪 — emax · 2026-09-10