IntBMoE 提出 block 级稀疏执行 MoE,已上线高德推荐服务数亿用户
Ran Cheng · hf · 2026-09-21
高德 AMap-ML 团队提出 IntBMoE,一种 block 条件化的全参与 MoE 架构。论文指出,现有 MoE 设计无法独立控制单个 token 的三个量:参与度(多少专家贡献输出)、执行量(实际计算多少,算力成本)和物化量(需存储多少专家参数,显存成本)——稀疏路由牺牲参与度,稠密混合推高执行成本,参数合溶则膨胀存储。
IntBMoE 的做法是:
- 用小型可学习码本生成 block,每层由轻量超网络把该层专家池全部合并为一个组合专家,保证全参与;
- 路由器只把 token 分到少量 block,执行保持稀疏;
- block 数量由码本而非输入决定,物化量有上界;
- 配套双路径残差门控(DPRG),通过乘性门控耦合两条独立组合路径。
实验在图像分类上稳定超过代表性稀疏/稠密 MoE 基线,并在语言建模与序列推荐上验证泛化性。该架构已部署于高德生成式推荐系统,在 60ms 延迟预算下服务数亿用户,线上 A/B 测试带来 2.4% 的相对 UVCTR 提升。代码开源于 GitHub(AMAP-ML/DreamX-Rec)。
「研究」频道最新
- 478 份提交角逐 5 万美元奖金,Aletheia AI 撒谎检测大赛揭晓获奖者 — gsarti_ · 2026-09-21
- IBM 发起 Steerability 大赛:征方案抑制大模型说谎,奖金取胜者登上 NeurIPS — davidbau · 2026-09-21
- 腾讯开源 T-Mem:联想召回记忆架构,LoCoMo-Plus 仅掉 5.45 分 — blaizedsouza · 2026-09-21
- Radial Duality:把约束优化化为无约束 Lipschitz 问题的理论 — prof_grimmer · 2026-09-21
- LoRA 只调局部参数即可替代全量微调,物理模型推断省八成内存 — bravo_abad · 2026-09-21
- 干细胞成像模型量化实测:W4/W8 混合压缩 6.76 倍零失败 — capicu-ai · 2026-09-21