Yann LeCun 团队发布多模态预训练新研究

burny_tech · x · 2026-08-17

Yann LeCun 等人发布论文《Beyond Language Modeling》,探索原生多模态预训练。研究采用 Transfusion 框架(语言用 Next-token,视觉用 Diffusion),通过从头训练揭示了四个关键洞察:(1) 表示自编码器(RAE)能统一视觉理解与生成;(2) 视觉与语言数据互补产生协同效应;(3) 统一预训练自然通向世界建模能力;(4) 混合专家(MoE)架构能有效扩展模态并诱导模态专业化。此外,IsoFLOP 分析表明视觉比语言更吃数据。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →