Yann LeCun 团队发布多模态预训练新研究
burny_tech · x · 2026-08-17
Yann LeCun 等人发布论文《Beyond Language Modeling》,探索原生多模态预训练。研究采用 Transfusion 框架(语言用 Next-token,视觉用 Diffusion),通过从头训练揭示了四个关键洞察:(1) 表示自编码器(RAE)能统一视觉理解与生成;(2) 视觉与语言数据互补产生协同效应;(3) 统一预训练自然通向世界建模能力;(4) 混合专家(MoE)架构能有效扩展模态并诱导模态专业化。此外,IsoFLOP 分析表明视觉比语言更吃数据。
「研究」频道最新
- 卡马克质疑流式 RL:单次观测即丢弃是糟糕设计 — ID_AA_Carmack · 2026-08-17
- AI 智能体科学发现:从文献到新蛋白质序列的端到端管线 — BrianHie · 2026-08-17
- 深度强化学习圈的黑话:代理损失其实是「假损失」 — burkov · 2026-08-17
- 新基准评估 AI 生成视频检测器:现实危机场景下泛化能力差 — huggingface · 2026-08-17
- HumanTracker 基准发布:评估人形机器人运动跟踪质量 — GalaxyGeneralRobotics · 2026-08-17
- 新方法提升推理效率:验证关键声明而非采样更多答案 — WeiboAI · 2026-08-17