高德 IntBMoE 全池参与只跑少数块,线上 UVCTR 相对升 2.4%

IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts

Ran Cheng, Longfei Xu, Zheng Liu, Kaikui Liu, Xiangxiang Chu

cs.LG

2026-09-18

阿里高德提出 IntBMoE:有界码本把整池专家合成可复用块,token 只跑少数块。ImageNet Top-1 达 73.76%,开屏推荐缓存后平均 19 毫秒,UVCTR 相对提升 2.4%。

这篇在解决什么

MoE 想把容量做大、单 token 算力做小。但现有设计把三件事绑在一起:参与度(多少专家的知识进了这个 token 的输出)、执行量(实际算了多少专家)、物化量(运行时要建多少份专家级参数)。

稀疏路由把执行压低,非选中专家既不贡献输出,也不从该 token 拿到梯度。密集混合输出让全员参与,执行随专家数线性涨。参数合并只跑一个合成专家,每个路由单元却要另建一份合成权重,物化量跟着路由决策走。

问题可以收成一句:每个 token 能不能吃到整个专家池,同时执行保持稀疏、物化份数有上界。

方法

IntBMoE 把「造变换」和「跑变换」拆开,替换 Transformer 的 FFN。每个模块维护大小为 K 的可学习码本,条目不依赖输入。共享超网络把码本向量映射成两组未归一化系数,分别合成 value 路径和 gate 路径。每一内部层的专家池按这些系数做方差保持的线性组合,得到 K 个可复用的 L 层块。系数允许为负,覆盖专家基的线性张成,不限在凸包里。

token 侧用两层 ReLU MLP 对这 K 个块做 Top-k。进块前,token 表征会和该块码本向量拼接,过一层 sigmoid 门做特征过滤,让不同块看到同一 token 的不同切片。块内部用 Dual-Path Residual Gating:value 与 RMSNorm 后的 gate 相乘,再加可学习残差缩放 λ。选中块按路由权重加权,加上一条始终开启的共享 SwiGLU。

块参数只由码本决定。推理时可以一次合成、全请求复用。缓存之后,请求时计算不再随专家池大小 E 增长。

结果

主实验是 8 层 DeiT-Tiny 风格骨干、约 24M 参数、ImageNet-1K 从零训练,三随机种子平均。默认配置 (K, E, k, L) = (8, 16, 2, 2)。

方法Top-1Top-5激活参数 (M)FLOPs (G)
Dense66.40%87.69%3.941.45
SMEAR71.78%90.33%22.891.49
Expert Choice71.70%90.30%5.141.96
IntBMoE73.76%91.48%23.114.06
IntBMoE(缓存)---3.46

相对最强对照 SMEAR,Top-1 高 1.98 个点。消融里去掉 gate 路径掉到 68.04%,两层块改成参数对齐的单层掉到 68.78%。逐个拿掉专家基都会掉点,Layer 0 去掉 E15 掉 9.15 个点,说明整池确实在干活,贡献很不均匀。

MiniPile 测试 loss 2.6802、PPL 14.59,相对 μMoE (CP) 的 15.03 降 2.9%,相对 dense 的 16.66 降 12.4%。IntTravel 上 HR@1 0.6852,略高于 μMoE (TR) 的 0.6837。

高德开屏 POI 推荐把合成块缓存掉。一周 A/B 约 5000 QPS,平均 19 ms、P99 38 ms,落在 60 ms 预算内,UVCTR 相对提升 2.4%。对照是现网无 MoE 模型。

为什么重要

少见的「论文数字 + 大规模在线」成套交代。缓存把合成从请求路径拿掉,适合延迟硬约束的推荐服务。对要在固定时延里加容量的团队,这块比 ImageNet 上那 2 个点更有用。

主表仍是 24M 视觉模型从零训,不是 LLM 规模验证。线上对照是「从无 MoE 到有 IntBMoE」,不是「换一个 SOTA 稀疏 MoE」。

局限与存疑

相对 SMEAR 只多 1.98 个点,FLOPs 却从 1.49G 升到 4.06G(缓存后 3.46G)。激活参数接近全量,因为它把整池都用来造块。IntTravel 的 HR@1 只比最强基线高 0.0015,更接近噪声带里的微弱优势。K 从 8 扩到 32 只再涨 0.07 点,E 从 16 到 64 只再涨 0.15 点,容量扩张很快饱和。代码仓库指向 DreamX-Rec,论文没有给出独立于推荐系统的即插即用训练配方。

术语

原文与代码

相关论文

全部论文解读