腾讯混元梳理原生多模态预训练的缩放规律
Tencent-Hunyuan · hf · 2026-07-27
- 腾讯混元这篇工作研究的是:在固定算力预算下,从零开始训练原生多模态模型时,规模该怎么扩。
- 结论是:最小损失遵循可预测的 compute law,而 compute-optimal 的模型大小和 token 数都呈现幂律变化。
- 语言目标和多模态目标的缩放规律并不相同:语言分配规律对数据配比相对不敏感,但多模态分配规律会明显受配比影响。
- 文本更重的混合数据,只有在更大的模型规模下才更算力友好,因此最优资源分配会更偏向更大的模型容量。
- 作者还给出了一条效率前沿,明确描述模型大小、token 数与数据混合的配置关系;实验也显示这种原生多模态预训练能带来正向跨模态迁移,提升纯文本空间推理与多模态 in-context learning。
「多模态」频道最新
- Skywork Video 强调 AI 视频要走向完整制作流程 — Shruti_0810 · 2026-07-27
- Skywork Video 让品牌素材和风格可复用 — Shruti_0810 · 2026-07-27
- TapNow 用 CreativeOS 跑通深圳 AI 恐怖片黑客松 — 葬AI · 2026-07-27
- 微调后的 Krea 2 raw 模型做出了一张雨夜驾驶图 — darlens13 · 2026-07-27
- 有人在问 Video2X 能否加载 OpenModelDB 自定义模型 — Used-Profit2355 · 2026-07-27
- 有人想让 AI 逆向拆解爆款视频特效成 ComfyUI 流程 — stale2000 · 2026-07-27