新论文给出原生多模态预训练的最优缩放规律
burny_tech · x · 2026-07-28
- 这篇论文系统研究了从零开始的原生多模态预训练,重点是 vision-language 模型在固定算力下的最优模型规模、token 数与数据配比。
- 结果表明,语言目标和多模态目标遵循不同的缩放规律:语言侧的最优分配对数据构成相对稳定,而多模态侧对数据混合比例更敏感。
- 论文指出,偏文本的数据混合只有在更大规模下才更算力高效,因此在追求更强多模态能力时,最优资源分配会更倾向于更大的模型容量。
- 作者还发现,原生多模态预训练会带来正向迁移,提升纯文本空间推理能力,并增强鲁棒的多模态 in-context learning。
所属事件:腾讯混元提出原生多模态预训练最优缩放规律(2 条相关)→
「多模态」频道最新
- Netflix 的 ID-V2V 从单段视频保持身份并重风格化 — netflix · 2026-07-28
- dRAE 将视觉离散化扩到 13.1 万 token,避免 codebook 崩塌 — burny_tech · 2026-07-28
- 新 ComfyUI 节点可把音频转成 MIDI — MuziqueComfyUI · 2026-07-28
- Boogu-Image-0.1 用 2.08 亿图像和 40 万美元冲到开源前列 — 机器之心 · 2026-07-28
- ComfyUI 基础概念探讨:为何工作流要拆分 Checkpoint 与 KSampler? — DavidThi303 · 2026-07-28
- RTX 4060 跑 Z Image Turbo 出图:如何突破画质上限? — Dangerous_Ring_435 · 2026-07-28