Sand.ai开源千亿级MoE模型MAGI-2,音视频生成成本降至1/10
新智元 · wechat · 2026-08-06
Sand.ai 团队正式发布并开源了全球首个千亿级 MoE 统一音视频生成模型 MAGI-2 Preview。该模型总参数量达 1140 亿,但单次前向计算仅激活约 60 亿参数,推理成本降至主流模型的十分之一。
核心架构与技术突破:
- 超细粒度 MoE:将 3072 维表示拆分为 12 个 256 维子空间,每层拥有 3072 个 head-local 专家单元,单 Token 仅调用 72 个,实现更丰富的能力组合。
- HeadParallel 通信机制:打破传统“先路由、再通信”模式,改为“先通信、再路由”,使跨设备传输量固定,不再随激活专家数线性增长,彻底解决细粒度路由带来的通信瓶颈。
- 统一音视频生成:摒弃“先生成视频再配音”的后期拼接模式,将文本、视频和音频放入同一上下文建模,从底层实现高保真的音画同步与口型对齐。
性能与成本:
在 ArtificialAnalysis 图生视频榜单中位列第六。按 8 卡 H100 折算,生成 10 秒视频成本仅约 0.5 元人民币,为视频产品团队大幅降低了商业门槛。
所属事件:Sand.ai 开源千亿参数模型 MAGI-2,音视频生成成本降九成(3 条相关)→
「多模态」频道最新
- 实测 Google Lyria 3.5:首个无金属感的 AI 音乐模型 — oyacaro · 2026-08-26
- 实测 Wan 3.0 与 Seedance 视频生成效果 — Aiden_Tech_Ai · 2026-08-26
- Minimax H3 周报:像素风节点、LoRA 与 ControlNet — optimisticalish · 2026-08-26
- AI 短剧 Mary Sue 第四集上线,剪映 + Seedance 2.5 制作 — gen_ericai · 2026-08-26
- 微软 MAI-Image-2.6 登顶图像编辑榜单 — ArtificialAnlys · 2026-08-26
- 质疑多模态定义:混合思维 MLLMs 的响应模式对齐研究 — YouJiacheng · 2026-08-26