Motif 3:314B MoE 只激活 13.2B,新注意力 GDLA 撑起强 agent 能力

Motif 3: Technical Report

Junghwan Lim, Joon Son Chung, Sungmin Lee, Wai Ting Cheung, Gihun Cho, Minsu Ha, Sangho Kang, Beomgyu Kim, Dongseok Kim, Jangwoong Kim, Taehyun Kim, Taewhan Kim, Jeesoo Lee, Jeongdoo Lee, Junhyeok Lee, Dongpin Oh, Hyeyeon Cho, Dahye Choi, Jaeheui Her, Hanbin Jung, Changjin Kang, Minjae Kim, Youngrok Kim, Hyukjin Kweon, Hongjoo Lee, Yeongjae Park, Bokki Ryu

cs.AI

2026-08-10

314B 开源 MoE 每 token 只激活 13.2B;自研 GDLA 注意力合并差分降噪与 MLA 压缩 KV,agent 任务不输更大模型,纯知识与科学编码偏弱。

这篇在解决什么

开源大模型这两年一直在缩小跟闭源的差距,而混合专家(MoE)架构让模型容量能涨上去、单 token 的计算成本却不跟着涨。这篇要解决的问题是:在大规模训练下,怎么用更有表达力又更高效的架构,把海量数据和算力真正变成又广又强的能力。Motif 3 是 Motif Technologies(韩国团队)交出的一个 314B 总参、每 token 只激活 13.2B 的 MoE 语言模型。

方法

模型的核心是自研的分组差分潜在注意力 GDLA,把三件事合在一起。差分注意力(出自 Differential Transformer)的思路是用一个注意力分布减去另一个,把信号和噪声共有的模式抵消掉,让注意力更集中在相关上下文。它原本对称,给信号和噪声各分一半头容量;分组差分(GDA)改成不对称,把更多头分给信号路径,噪声头少量共享,用更少计算换更强信号建模。多头潜在注意力(MLA,出自 DeepSeek)则把 KV 状态压成低秩潜在表示,大幅省推理时的 KV 缓存。GDLA 把差分降噪、GDA 的不对称信号建模、MLA 的紧凑推理状态合在一起,还加了一个依赖查询的输出门控。在约 10B 参数的受控实验里,GDLA 比 MLA 少用 9.2% 的 token 就达到 3.2 的损失。

架构上还有几处改动:用 1 全注意力加 3 滑窗的混合注意力调度;用修改过的流形约束超连接(mHC)替代常规残差加,把单残差流扩成 4 条并行流,关键是把后映射乘子在训练中从 2 退火到 1,防止残差放大在深层累积出激活异常;每个专家有自己一套多项式激活系数(Expert-Specific PolyNorm),让不同专家的非线性响应各异以促专化;还加了多 token 预测头做自投机解码。每层 384 个路由专家里每 token 选 8 个,加 1 个共享专家。

预训练用了约 12.5 万亿 token(网页、STEM、代码、数学、多语言,额外强调韩语和法律金融)。后训练走通用 SFT,再加七个专家教师(六个用 GRPO 强化学习训、一个软件工程教师用 SFT),最后用多教师在线策略蒸馏(MOPD)把七个教师的能力揉进一个学生。整个模型是纯文本,最大上下文 256K。

结果

跟几个大得多的开源模型比(MiniMax-3 428B-A23B、GLM-5.1 744B-A40B、Kimi-K2.6 1T-A32B、Qwen-3.7 Max、DeepSeek-v4-Pro 1.6T-A49B),Motif 3 在 agent 和工具类任务上最亮眼。τ3-Banking 拿 35.3(表里最高,第二名才 30.1),τ2-Bank Telecom 94.7,Terminal-Bench 2.1 拿 74.9(近最高),ITBench-AA 公开子集 51.5(表里可用结果最高)。这跟它用 MOPD 把 agent、工具使用、软件工程等专长揉成一个学生的做法吻合。

维度Motif 3表里最强
τ3-Banking35.335.3(最高)
Terminal-Bench 2.174.975.0(Qwen-3.7)
SWE-bench Verified76.280.4(Qwen-3.7)
GPQA Diamond83.492.9(MiniMax-3)
SciCode40.653.5(Kimi/Qwen)

弱项也很清楚:纯知识类 GPQA Diamond 83.4,远低于 MiniMax-3 的 92.9;科学编码 SciCode 40.6,专业科学推理 CritPt 6.6,都低于最强模型。校准上有个有意思的点:AA-Omniscience 准确率 30.1 不算高,但不幻觉分 71.6 是表里最高之一(DeepSeek-v4-Pro 只有 5.9),说明它在「答对」和「不乱答」之间取了偏保守的平衡。

为什么重要

对一个 13.2B 激活量的模型,在 agent 与终端任务上能跟 1T 级的模型掰手腕,本身说明激进稀疏(384 选 8)加上专门的多教师蒸馏是条走得通的路。GDLA 把差分降噪和 KV 压缩合在一起,对既要长上下文又要省显存的工程部署有参考价值。对关注非英语(尤其韩语)开源生态的人,这也是一份国家级基础模型的实测样本。

局限与存疑

纯文本模型,处理视觉输入的任务直接做不了,作者列为首要局限。GDLA 的优势只在约 10B 的受控实验里验证过,全量 314B 上是否同样成立,论文没有直接对照。训练和评测没覆盖真实任务的全部多样性、领域、语言和部署条件,训练里偏弱的任务(科学编码、专业科学推理)确实在分数上反映出来了。支持 256K 长上下文,但长程 agent 应用需要的状态跟踪、规划、恢复能力,远超这里评测的轨迹长度,作者承认这块还差得远。

术语

原文与代码

相关论文

全部论文解读