探究多模态预训练底层机制:135亿参数模型揭示模态竞争与视觉惰性
khademinori · x · 2026-08-07
当前大多数大模型仍以纯语言预训练为起点,直接进行原生多模态训练面临极易出现的不稳定性和模态竞争等挑战。本研究系统拆解了多模态预训练的底层物理机制,主要探讨了四个维度:
- 知识流动:跨语言、理解与生成的知识转移具有高度不对称性,且依赖于具体概念。
- 模态协同与竞争:任务复杂度和架构参数共享决定了不同模态间是相互促进还是相互竞争。
- 早期统一:在预训练初期就同步融合视觉等模态,效果远优于后期或顺序训练。若视觉路径介入过晚,模型会产生“视觉惰性”。
- 配方与规模化验证:基于受控环境的洞察,研究团队构建了高效的预训练配方,并在 2T tokens 数据量上成功训练了 135B 参数的 MoE 模型以验证其扩展性。
所属事件:Meta 研究揭示多模态预训练底层机制(4 条相关)→
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24