北大等提出 UltraEP:突破大规模 MoE 训练 GPU 负载瓶颈
jiqizhixin · x · 2026-08-09
北京大学、小红书与上海AI Lab联合提出了 UltraEP 框架,旨在解决数百上千 GPU 训练巨型混合专家模型时的负载同步与瓶颈问题。
- 核心机制:作为一个实时负载均衡器,它能在机架级节点内不断重新分配 GPU 计算任务,针对每个微批次和层级进行动态调整,防止单个 GPU 拖慢整体效率。
- 性能表现:在极低通信开销下,达到了理想吞吐量的 94.3%;相比无均衡策略实现了 1.49 倍的加速,并将负载不均衡度从最高 4 倍降至接近完美平衡。
- 测试规模:在 106B 到 671B 参数的尖端 MoE 模型上进行了验证,最高跨越 256 个 GPU。
「Infra」频道最新
- LeCun 辩 AI 算力战:突破性芯片常因软件匮乏而失败 — ylecun · 2026-08-09
- 高通 GenieX 实操:在骁龙设备用 NPU 跑大模型 — carrycooldude · 2026-08-09
- AI 算力代价:英国数据中心扩张正引发水资源与电力危机 — nordicinst · 2026-08-09
- 开发者制作 MiniMax H3 RunPod 一键部署模板 — Draufgaenger · 2026-08-09
- 亚马逊自建巨型燃气电厂,或成全美最大气候污染源 — Nunki08 · 2026-08-09
- AMD优化llama.cpp:减少MTP缓冲开销,上下文长度翻倍 — ea_man · 2026-08-09