Motif 3 技术报告:314B 参数稀疏 MoE 大模型
Motif-Technologies · hf · 2026-08-11
Motif Technologies 发布 Motif 3 技术报告,这是一款拥有 3140 亿总参数、每次激活 132 亿参数的 Decoder-only 混合专家 语言模型。
- 架构创新:每个稀疏 MoE 层包含 384 个路由专家(每 token 选 8 个)。核心引入了分组差分潜在注意力 (GDLA),结合了差分注意力与多头潜在注意力的压缩 KV 特性。还采用了流形约束超连接、专家特定 PolyNorm 激活和多 token 预测。
- 训练规模:在约 12.5 万亿 token 上进行预训练,涵盖网页、STEM、代码、数学和多语言内容。通过选择性 MXFP8 计算和内存高效融合核,支持长达 256K 上下文训练。
- 后训练与性能:结合了监督微调、6 个强化学习训练的专家教师模型和多教师策略蒸馏。统一后的模型在推理、编码、长上下文理解和指令遵循等方面表现出色,在长程智能体任务和数学推理上取得了极具竞争力的成绩。
「模型」频道最新
- 本地开源模型实现代码自检运行,订阅价值何在? — truecakesnake · 2026-08-11
- OpenAI 模型被指过度压制创造力,用户呼吁开放温度调节 — RileyRalmuto · 2026-08-11
- GLM-5.2 定价极具竞争力,智能成本正急剧下降 — tobowers · 2026-08-11
- 开发者盛赞 Kimi K3:宛如真实版 Llama 4 Behemoth — willccbb · 2026-08-11
- 阿里官方确认:Qwen3.8-27B 开源权重本周发布 — max_paperclips · 2026-08-11
- Abacus AI 发布 Smaug-Agentic:登顶开源智能体编码榜首 — bindureddy · 2026-08-11