联通MoHGE用分组两级路由把MoE总参砍约16%仍打平

Mixture of Heterogeneous Grouped Experts for Language Modeling

Zhicheng Ma, Xiang Liu, Zhaoxiang Liu, Ning Wang, Yi Shen, Kai Wang, Shuming Shi, Shiguo Lian

cs.CL, cs.AI, cs.LG

2026-04-25

联通MoHGE把专家按宽度分组并用两级路由选组,相对标准MoE总参少约16%、激活专家参少约四分之一,下游持平且GPU均衡。

这篇在解决什么

标准 MoE 里每个专家一样宽。简单 token 和难 token 付同一笔计算。工业推理里这是实打实的浪费:大量 token 用不上最大专家的容量。

异构专家想按难度配宽度。MoDSE 把路由概率往均匀推,token 经常进不了合适的专家,小专家吃不饱。HMoE 提过异构加同构的混合方向,但大小不一的专家摊到多卡上,有的卡打满、有的卡空转,训练吞吐和扩卡都会卡住。

要同时满足两件事:容量跟 token 难度对齐,GPU 上的活还得均匀。

方法

MoHGE 把专家按组切。组内宽度相同,组间按预设递进拉开。第 i 组隐层宽度为 Wi = 2×Wbase - W{Ng-i},小专家处理简单模式,大专家扛复杂上下文。

路由分两级。组门控对每个 token 用 sigmoid 对组中心向量打分,只留 top-Kg 个组。专家门控再在入选组里做 softmax,分数乘上组分数后做全局 top-Ke,最后归一化。先锁组再锁专家,组合空间比每个专家一个尺寸的全异构更宽,计算也被限制在入选组内。

大专家表征更强,不加约束路由会全涌过去。Group-Wise Auxiliary Loss 按组的参数量 Wi 给大组加极小的惩罚系数 αG,让门控在交叉熵和参数成本之间做权衡,能用小组就用小组。

GPU 均衡靠放置和损失一起做。All-size Group-decoupling Allocation 把每个组的第 i 号专家绑成一套放到同一张卡,每张卡上的专家总参数量对齐。Intra-Group Experts Auxiliary Loss 把 DeepSeekV2 的全局专家平衡改成组内平衡,组内被点到的频率拉齐。组内齐了,按 All-size 放置后卡间也齐。

结果

主实验走 OpenCompass,zero-shot 或 few-shot,三次评估取平均。

方法总参数专家激活参数MMLUGSM8KMATHTriviaQA
Dense0.807B–26.362.791.3334.98
MoE-3B3.3614B0.376B26.223.031.3439.16
MoHGE-3B2.821B0.295B26.414.021.3639.20
Dense1.672B–30.784.626.8250.26
MoE-14B16.760B1.191B31.184.927.3051.77
MoHGE-14B14.122B0.843B31.625.769.4252.69

摘要写总参大约少 20%。表内更接近 16%:3B 从 3.3614B 降到 2.821B,14B 从 16.760B 降到 14.122B。专家层激活参数大约少四分之一,3B 从 0.376B 到 0.295B,14B 从 1.191B 到 0.843B。七项任务上 MoHGE 分数都不低于同档 MoE。14B 上 MATH 从 7.30 到 9.42,GSM8K 从 4.92 到 5.76,MMLU 从 31.18 到 31.62,都是小幅增益。3B 的 GSM8K 从 3.03 升到 4.02,相对涨幅更大,绝对分数仍只有个位数。3B 的 PIQA 与 MoE 同为 49.08,增益可以忽略。

下游评测耗时上,MoHGE 多数任务比同档 MoE 略快,14B 的 MMLU 是 18.86h 对 MoE 的 19.27h。GSM8K 会偏向大专家组,3B 耗时 0.86h,略慢于 MoE 的 0.84h。Dense 更快,因为它没有路由开销,总参也大约等于 MoE 的激活量。

14B 把每组第 i 号专家放到第 i 张卡上统计:八组在八张卡上的 token 占比都贴着 12.5%,组内标准差大约 0.002 到 0.003。3B 上自行复现 MoDSE 和 HMoE,MoHGE 在 MMLU 上为 26.41,对照 MoDSE 的 26.27 与 HMoE 的 26.34;GSM8K 为 4.02,对照 3.71 与 3.94。HMoE 分数接近,但 GPU 不均衡。

路由方向也对得上设计。按训练集词频,Top 1K 简单 token 进最小 Group 1 占 16.3%、进最大 Group 8 只 9.7%;Beyond 10K 的难 token 则 Group 1 降到 11.3%、Group 8 升到 13.3%。按 perplexity 切,PPL≤5 更常进小组,PPL>10 更常进大组。去掉 Group-Wise Auxiliary Loss 之后,token 会重新扎堆大组。

为什么重要

这是工业向的渐进改进,让异构 MoE 在多卡上负载能齐。抠推理成本时,可以用两级路由把简单 token 打到小组,不必给每个专家单独做一套宽度。

它没有对标超大规模生产 MoE。能确定的是:在 3B 和 14B 总参、OpenCompass 这套题上,少约六分之一总参、少约四分之一专家激活量,分数不掉,GPU 路由统计能齐。

局限与存疑

正文没给出预训练 token 数、训练步数、组数 Ng、Kg 与 Ke、αG 与 αE 的具体取值,消融放在附录。3B 和 14B 的 MoE 基线如何对齐层数、宽度和激活专家数,主文没有完整表格。

下游绝对值很低。MoHGE-14B 的 GSM8K 只有 5.76,MATH 只有 9.42。这更像短训或小语料 checkpoint 上的相对比较,不能当成可部署模型的绝对水平。摘要「约 20%」和表内约 16% 也对不齐,对外传播容易被四舍五入成 20%。

HMoE 对照是自行复现的 Top-P 版本,和原论文是否同设置,主文无法核实。All-size 放置默认组内已经均衡;如果推理流量把某一组打满,卡间会不会再歪,论文只给了评测路由统计,没有不均匀流量压测。

术语

原文与代码

社区讨论

相关论文

全部论文解读