LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen
cs.AI
2026-08-04
作者首次系统刻画 MoE 扩散语言模型的 scaling law,据此从头训出 30B-A3B 的 LLaDA MoE v2(23.5T token),用约 65% 的训练量在多项知识、推理、代码基准接近 Qwen3,SFT 后于 8 项里 7 项胜过 SDAR Chat。
扩散语言模型(diffusion language model,dLLM)是大语言模型的另一条技术路线。它先把一句话里的一部分 token 换成掩码,再让模型并行地把它们还原回来,不逐字往后生成。这条路线被看好,是因为生成时天然支持并行解码、可以反复修改。但过去几乎所有 scaling law 和训练超参的工程经验都来自自回归模型(AR),dLLM 多半直接照搬。问题在于两套模型优化的东西根本不同:dLLM 只在被打掩码的位置上算损失,而每个预测看到的输入是被污染过的序列,不是 AR 那种干净的前缀。照搬 AR 的超参,等于在错误的坐标系里做预算。
MoE(Mixture-of-Experts)版本的 dLLM 问题更大:专家怎么配、激活多少、共享专家占几成,这些选择在 AR MoE 里已经有惯例,在 dLLM 里却几乎没人系统测过。这篇就是把这块空白填上,并据此训出一个能打的模型。
作者做了三组 scaling 实验,模型从 158M 扫到 3.6B,算力从 10^18 到 3×10^20 FLOPs。
第一组是优化超参。拟合得到最优 batch size 随算力按 B = 0.374·C^0.3481 增长,最优学习率按 η = 64.8·C^-0.2447 衰减。和 DeepSeek 那条 AR 的律相比,dLLM 该用的 batch 涨得更快、学习率掉得更快:在 10^20 FLOPs 处,dLLM 律预测的最优 batch 对应 343 万 token,AR 只有 102 万;学习率 dLLM 8.27×10^-4,AR 9.86×10^-4。直觉上说得通:并行还原多个掩码位置、每次输入还带噪,梯度更吵,要更稳就得更小的步长配更大的批。
第二组是算力在「模型规模」和「数据量」之间的分配,用 IsoFLOP 分析。得到模型前沿 M(C)=0.5152·C^0.475、数据前沿 D(C)=1.9411·C^0.525。两个指数说明,随着算力增加,最优 token 预算涨得比模型计算量稍快,是略微偏数据侧的倾斜。这和稠密 dLLM 的前沿(偏模型侧)方向相反。
第三组是 MoE 结构。在固定激活算力下扫了三个维度:激活比例 A 越稀疏(越小)在大规模上越划算;专家粒度 G 在 8 到 16 之间最稳,不随算力单调变化;共享专家占比 S 在 33.3% 上一直最优,这点和 AR MoE 的设计习惯不一样。最后落到 (A, G, S) = (9.09%, 8, 33.3%):128 个路由专家、每层 top-8 路由、外加一个宽度 4 倍的共享专家。
按这套设计从头训 LLaDA MoE v2:总参 30B,激活 3B(30B-A3B),训练分五个阶段共 23.5T token,其中含长上下文退火到 32K。
预训练阶段(选几项,对照 Qwen3 与 SDAR Sci):
| 基准 | LLaDA MoE v2 | Qwen3 | SDAR Sci |
| MMLU | 78.01 | 81.38 | 82.72 |
| MMLU-Pro | 57.28 | 61.49 | 56.96 |
| GSM8K | 83.93 | 91.81 | 86.13 |
| MATH | 54.72 | 59.04 | 48.52 |
| MBPP | 71.00 | 74.40 | 60.40 |
| LiveCodeBench v6 | 31.86 | 49.18 | 39.87 |
在 MMLU-Pro、MATH、MBPP 上它已经超过同为扩散路线的 SDAR Sci,但和 Qwen3 比仍有差距,尤其 LiveCodeBench v6 落后近 17 分。中文基准差距更明显:CEval 76.11 对 Qwen3 的 87.50,CMMLU 77.99 对 86.35。
只做 SFT(3 轮、700 万条指令数据、无 RL)后,在 8 项推理/代码里有 7 项超过 SDAR Chat。例如 AIME24 30.00 对 16.70、MultiPL-E 67.52 反而压过 Qwen3 的 66.60。和 Qwen3 整体仍有距离,但差距比预训练阶段缩小。
这是扩散语言模型第一次有了一套属于自己的 MoE scaling law 和结构配方。过去想训 dLLM 只能照抄 AR 的超参表,现在 batch、学习率、模型/数据配比、专家配置都有了可直接套用的律。对从业者最实际的信号是:30B-A3B 的扩散模型已经能在不少英文知识和推理任务上贴近 Qwen3 这个级别的自回归模型,而且只用了大约 65% 的训练 token。这是「扩散路线能上规模、能打」目前最有分量的一份证据。
但「接近 Qwen3」要分开看:英文知识、数学、中等难度代码确实接近,中文和实时代码还差一截。把扩散模型当成现成替代品还早。
作者自己承认,三个维度的实验是分开做的,没测它们之间的交互。scaling law 通常假设维度可分离,但 MoE 里激活比例和专家粒度很可能耦合,这条简化会带来多大误差没给。
读下来还有两点没被验证:一是只做了 SFT、没用 RL,推理上限没被顶起来,和 Qwen3 的对比因此不完全对等;二是中文和硬代码的差距不小,说明数据配比或训练策略还有短板,但论文没拆开归因。23.5T token 里中文占比、各阶段数据构成也没交代清楚,复现和归因都难。