Meta/Oxford研究:多模态模型图像生成数据仅需5%,语言训练是关键
rohanpaul_ai · x · 2026-08-14
Meta与牛津大学的研究发现,多模态模型可能只需要很少的图像生成数据,如果从一开始就同时训练语言和视觉理解。语言训练已经帮助模型理解视觉,而学习理解图像也能提升生成能力,但训练生成图像对语言或图像理解帮助甚微。在1T token实验中,最佳数据分配为70%语言、25%图像理解、5%图像生成。在13.5B规模、2T token的测试中,即使图像生成token减少5倍,GenEval分数从0.467提升至0.482,语言和图像理解也同步提升。研究还警告不要过晚加入视觉训练,否则模型会忽视图像而依赖语言捷径,称为“视觉懒惰”。论文标题:Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes。
「多模态」频道最新
- DGX Spark 跑 Minimax H3 视频生成:每 5 秒仅耗资 0.1 美分 — GabryIta · 2026-08-14
- 新手困惑:SDXL模型还值得学吗? — Foreign-Roof4913 · 2026-08-14
- Minimax H3 Ref2VA Lipsync工作流发布 — Most_Way_9754 · 2026-08-14
- MiniMax Music 3 开源上线,社区预言开源音乐革命即将爆发 — TheChuckTone · 2026-08-14
- MiniMax H3 视频生成实测:保龄球场景效果惊艳 — howdyquade · 2026-08-14
- 文本生成音乐模型挑战:硬style鼓点成难题 — cephaloform · 2026-08-14