联通提出异构分组MoE架构MoHGE,参数减20%入选ACL 2026
量子位 · wechat · 2026-10-04
中国联通数据科学与人工智能研究院团队提出异构分组混合专家架构 MoHGE,入选 ACL 2026,代码已开源。
该架构针对传统 MoE「所有专家同尺寸」导致的算力浪费,以及现有异构专家架构 GPU 负载不均的问题,设计了三大机制:分组异构专家加两级路由(组级门控+专家级门控)、基于参数量的组级辅助损失(把简单 token 路由到小专家)、以及全尺寸解耦分配策略,让每张 GPU 均匀分到含所有尺寸专家的组合,保证负载均衡。
实验显示,在 3B 和 14B 规模下,MoHGE 相比同精度基线 MoE 减少约 20% 总参数量,单次推理激活参数降低近四分之一,同时准确率持平甚至反超,在数学推理任务上尤为突出,各 GPU 节点负载高度一致。
「Infra」频道最新
- Will Chamberlain:若 AGI 同期到来,数据中心建设的激进程度本会收敛 — willcb · 2026-10-04
- UBS 预测 2030 年全球机架部署将达 104.5 GW,Nvidia 占 50.5 GW — AccBalanced · 2026-10-04
- 马斯克称 xAI 明年底算力扩至 10GW,AI 推理将移向太空 — beffjezos · 2026-10-04
- BF16 舍入破坏守恒律,FlashAttention 梯度训练后期爆炸 — HongyiWang10 · 2026-10-04
- 玩家用 BC-250 成功跑通 PyTorch CUDA 训练并做成系统镜像 — redfoxkiller · 2026-10-04
- 华为 950 超节点宣称支持 550B、1.6T 扩展至 10T 级模型训练 — teortaxesTex · 2026-10-04