Mixture of Heterogeneous Grouped Experts for Language Modeling
Zhicheng Ma, Xiang Liu, Zhaoxiang Liu, Ning Wang, Yi Shen, Kai Wang, Shuming Shi, Shiguo Lian
cs.CL, cs.AI, cs.LG
2026-04-25
联通MoHGE把专家按宽度分组并用两级路由选组,相对标准MoE总参少约16%、激活专家参少约四分之一,下游持平且GPU均衡。
标准 MoE 里每个专家一样宽。简单 token 和难 token 付同一笔计算。工业推理里这是实打实的浪费:大量 token 用不上最大专家的容量。
异构专家想按难度配宽度。MoDSE 把路由概率往均匀推,token 经常进不了合适的专家,小专家吃不饱。HMoE 提过异构加同构的混合方向,但大小不一的专家摊到多卡上,有的卡打满、有的卡空转,训练吞吐和扩卡都会卡住。
要同时满足两件事:容量跟 token 难度对齐,GPU 上的活还得均匀。
MoHGE 把专家按组切。组内宽度相同,组间按预设递进拉开。第 i 组隐层宽度为 Wi = 2×Wbase - W{Ng-i},小专家处理简单模式,大专家扛复杂上下文。
路由分两级。组门控对每个 token 用 sigmoid 对组中心向量打分,只留 top-Kg 个组。专家门控再在入选组里做 softmax,分数乘上组分数后做全局 top-Ke,最后归一化。先锁组再锁专家,组合空间比每个专家一个尺寸的全异构更宽,计算也被限制在入选组内。
大专家表征更强,不加约束路由会全涌过去。Group-Wise Auxiliary Loss 按组的参数量 Wi 给大组加极小的惩罚系数 αG,让门控在交叉熵和参数成本之间做权衡,能用小组就用小组。
GPU 均衡靠放置和损失一起做。All-size Group-decoupling Allocation 把每个组的第 i 号专家绑成一套放到同一张卡,每张卡上的专家总参数量对齐。Intra-Group Experts Auxiliary Loss 把 DeepSeekV2 的全局专家平衡改成组内平衡,组内被点到的频率拉齐。组内齐了,按 All-size 放置后卡间也齐。
主实验走 OpenCompass,zero-shot 或 few-shot,三次评估取平均。
| 方法 | 总参数 | 专家激活参数 | MMLU | GSM8K | MATH | TriviaQA |
| Dense | 0.807B | – | 26.36 | 2.79 | 1.33 | 34.98 |
| MoE-3B | 3.3614B | 0.376B | 26.22 | 3.03 | 1.34 | 39.16 |
| MoHGE-3B | 2.821B | 0.295B | 26.41 | 4.02 | 1.36 | 39.20 |
| Dense | 1.672B | – | 30.78 | 4.62 | 6.82 | 50.26 |
| MoE-14B | 16.760B | 1.191B | 31.18 | 4.92 | 7.30 | 51.77 |
| MoHGE-14B | 14.122B | 0.843B | 31.62 | 5.76 | 9.42 | 52.69 |
摘要写总参大约少 20%。表内更接近 16%:3B 从 3.3614B 降到 2.821B,14B 从 16.760B 降到 14.122B。专家层激活参数大约少四分之一,3B 从 0.376B 到 0.295B,14B 从 1.191B 到 0.843B。七项任务上 MoHGE 分数都不低于同档 MoE。14B 上 MATH 从 7.30 到 9.42,GSM8K 从 4.92 到 5.76,MMLU 从 31.18 到 31.62,都是小幅增益。3B 的 GSM8K 从 3.03 升到 4.02,相对涨幅更大,绝对分数仍只有个位数。3B 的 PIQA 与 MoE 同为 49.08,增益可以忽略。
下游评测耗时上,MoHGE 多数任务比同档 MoE 略快,14B 的 MMLU 是 18.86h 对 MoE 的 19.27h。GSM8K 会偏向大专家组,3B 耗时 0.86h,略慢于 MoE 的 0.84h。Dense 更快,因为它没有路由开销,总参也大约等于 MoE 的激活量。
14B 把每组第 i 号专家放到第 i 张卡上统计:八组在八张卡上的 token 占比都贴着 12.5%,组内标准差大约 0.002 到 0.003。3B 上自行复现 MoDSE 和 HMoE,MoHGE 在 MMLU 上为 26.41,对照 MoDSE 的 26.27 与 HMoE 的 26.34;GSM8K 为 4.02,对照 3.71 与 3.94。HMoE 分数接近,但 GPU 不均衡。
路由方向也对得上设计。按训练集词频,Top 1K 简单 token 进最小 Group 1 占 16.3%、进最大 Group 8 只 9.7%;Beyond 10K 的难 token 则 Group 1 降到 11.3%、Group 8 升到 13.3%。按 perplexity 切,PPL≤5 更常进小组,PPL>10 更常进大组。去掉 Group-Wise Auxiliary Loss 之后,token 会重新扎堆大组。
这是工业向的渐进改进,让异构 MoE 在多卡上负载能齐。抠推理成本时,可以用两级路由把简单 token 打到小组,不必给每个专家单独做一套宽度。
它没有对标超大规模生产 MoE。能确定的是:在 3B 和 14B 总参、OpenCompass 这套题上,少约六分之一总参、少约四分之一专家激活量,分数不掉,GPU 路由统计能齐。
正文没给出预训练 token 数、训练步数、组数 Ng、Kg 与 Ke、αG 与 αE 的具体取值,消融放在附录。3B 和 14B 的 MoE 基线如何对齐层数、宽度和激活专家数,主文没有完整表格。
下游绝对值很低。MoHGE-14B 的 GSM8K 只有 5.76,MATH 只有 9.42。这更像短训或小语料 checkpoint 上的相对比较,不能当成可部署模型的绝对水平。摘要「约 20%」和表内约 16% 也对不齐,对外传播容易被四舍五入成 20%。
HMoE 对照是自行复现的 Top-P 版本,和原论文是否同设置,主文无法核实。All-size 放置默认组内已经均衡;如果推理流量把某一组打满,卡间会不会再歪,论文只给了评测路由统计,没有不均匀流量压测。