腾讯混元给出无编码器多模态预训练 Scaling Law:10^22 FLOPs 处反超
Tencent-Hunyuan · hf · 2026-09-29
腾讯混元团队系统对比了无视觉编码器(encoder-free)与基于视觉编码器的多模态大模型 MLLM 的 scaling 行为,回答「我们离去掉视觉编码器还有多远」。三大发现:
- 去掉视觉编码器会把多模态目标的计算最优分配推向更大模型,而文本目标几乎不变。
- 两种架构在文本目标上的 loss-compute 前沿几乎重叠,但在多模态目标上分化:encoder-free 在小规模下落后,预测在 约 10^22 FLOPs 处追平——这在实际预训练预算之内。
- 没有编码器时,语言模型会通过视觉特化适应接管其角色:视觉 token 间的双向交互随算力增长越来越有益、视觉处理前移到更早层、视觉 token 的专家路由更集中。
结论:预训练编码器的视觉先验优势随规模递减,encoder-free 架构是多模态预训练的有望方向。
「模型」频道最新
- 圈内人吐槽 AI 回复废话太多:简洁才是王道 — djcows · 2026-09-29
- 用户曝 Claude $200 订阅被砍半额度,官方却包装成更划算 — gandamu_ml · 2026-09-29
- 「Opus 5 是个恶魔」:用户对比称 Opus 5.5 行为明显更可控 — gandamu_ml · 2026-09-29
- 博主弃 Cursor+Grok,全天实测 Claude Code+Opus 5.5 — jonathan_wilke · 2026-09-29
- 同一提示词对决:Opus 5.5 Max effort vs Grok 4.7 Fast xhigh 生成动态视频 — FinanceYF5 · 2026-09-29
- 问一句"你怎么看"竟被 Opus 当作蒸馏攻击拒绝 — Dany0 · 2026-09-29