MiniMax M3 架构解密:MSA 稀疏注意力快 15 倍,从零原生多模态训练
AI Engineer · youtube · 2026-10-11
MiniMax 强化学习负责人 Olive Song 在 AI Engineer World's Fair 2026 上详解开源权重模型 MiniMax M3 的设计。M3 拥有 100 万 token 上下文、前沿级编码与智能体能力,且从训练第一步起就同时学习文本与视觉,而非先学文本后补视觉——事后加视觉会导致训练不稳定。
核心技术点:
- MSA 稀疏注意力:相比全注意力,prefill 提速约 9 倍、解码提速约 15 倍。设计分两条分支——index 分支负责筛选哪些 block 重要,sparse 分支只对选中的 block 做注意力;配套针对真实 GPU 显存访问优化的 kernel。
- 为什么不用 DeepSeek 的 DSA:现有稀疏注意力设计与 grouped-query attention 和 GPU 显存访问模式不兼容,因此重做了设计。
- 多模态训练策略:对比了不同训练策略,展示注意力图证据,并解释 ViT 内部采用 3D 注意力提升视觉理解。
演讲全文与技术报告(arXiv:2606.13392)、MSA 代码均已开源。
「模型」频道最新
- 本地 27B 模型做记账 50 项错 3 项,前沿模型全对但用户怕隐私 — redpandafire · 2026-10-11
- haiku 5.5 被赞疯狂性价比:百美元内让 agent 批量改上万文件 — JasonDClinton · 2026-10-11
- 用户实测:把 GPT-5.5 当平级同事对待,协作体验意外地好 — repligate · 2026-10-11
- 曝 Anthropic 要求 AWS 紧急下架 Bedrock 上 Sonnet 3.5/3.6/3.7 — repligate · 2026-10-11
- Sentry CEO 追问传闻中的 500 美元档 Claude 订阅 — zeeg · 2026-10-11
- 用户抱怨模型质量骤降:让做精准补丁却跳步瞎改,反复死循环 — JayJeds · 2026-10-11