Meta/Oxford研究:多模态模型图像生成数据仅需5%,语言训练是关键

rohanpaul_ai · x · 2026-08-14

Meta与牛津大学的研究发现,多模态模型可能只需要很少的图像生成数据,如果从一开始就同时训练语言和视觉理解。语言训练已经帮助模型理解视觉,而学习理解图像也能提升生成能力,但训练生成图像对语言或图像理解帮助甚微。在1T token实验中,最佳数据分配为70%语言、25%图像理解、5%图像生成。在13.5B规模、2T token的测试中,即使图像生成token减少5倍,GenEval分数从0.467提升至0.482,语言和图像理解也同步提升。研究还警告不要过晚加入视觉训练,否则模型会忽视图像而依赖语言捷径,称为“视觉懒惰”。论文标题:Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →