MiniMax M3 架构解密:MSA 稀疏注意力快 15 倍,从零原生多模态训练

AI Engineer · youtube · 2026-10-11

MiniMax 强化学习负责人 Olive Song 在 AI Engineer World's Fair 2026 上详解开源权重模型 MiniMax M3 的设计。M3 拥有 100 万 token 上下文、前沿级编码与智能体能力,且从训练第一步起就同时学习文本与视觉,而非先学文本后补视觉——事后加视觉会导致训练不稳定。

核心技术点:

演讲全文与技术报告(arXiv:2606.13392)、MSA 代码均已开源。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →