腾讯混元给出无编码器多模态预训练 Scaling Law:10^22 FLOPs 处反超

Tencent-Hunyuan · hf · 2026-09-29

腾讯混元团队系统对比了无视觉编码器(encoder-free)与基于视觉编码器的多模态大模型 MLLM 的 scaling 行为,回答「我们离去掉视觉编码器还有多远」。三大发现:

结论:预训练编码器的视觉先验优势随规模递减,encoder-free 架构是多模态预训练的有望方向。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →