NVIDIA 新方案:MoE 训练吞吐最高达 HF 基线 2.21 倍,B200 实测
AllThingsApx · x · 2026-09-29
NVIDIA 技术博客介绍面向生物基础模型的 MoE 高效训练方案(BioNeMo 团队),在 8 张 B200 上对比 Hugging Face BF16 基线,Mixtral-8x7B 训练吞吐最高提升 2.21 倍。
关键技术点:
- GroupedLinear:把多个专家 GEMM 合为一次分组操作提交,避免 Python 循环逐专家启动 kernel 的开销
- MXFP8 块缩放 8-bit 精度:比 BF16 显著省显存,Blackwell GPU 硬件加速
- TE Sequential API 融合:将 GroupedLinear、ScaledSwiGLU 和路由权重缩放融合进单个 ForwardGroupedMLPCuTeGEMMSwiGLUMXFP8 kernel,避免中间结果落显存
作者附注:该工作不含湿实验数据,属训练工程方向。官方建议从 Mixtral Native Transformer Engine recipe 入手尝试。
所属事件:NVIDIA BioNeMo 优化 MoE 训练,Mixtral 吞吐提升 2.21 倍(2 条相关)→
「Infra」频道最新
- 开源项目 Celesto:给 AI Agent 一台 500 毫秒启动的专属电脑 — aniketmaurya · 2026-09-29
- 手机+三台 Mac+两台 PC 拼出 60GB 内存,跑通 gpt-oss-120b — ANR2ME · 2026-09-29
- BioNeMo 团队优化稀疏模型训练:Mixtral 吞吐提升 2.21 倍 — AllThingsApx · 2026-09-29
- DeepSeek 弹性计算团队大量招人,发布大规模 Agent 训练沙盒基建分享 — teortaxesTex · 2026-09-29
- 开发者吐槽第三方推理服务乱象:Gemini 一年涨 10 倍 — julianharris · 2026-09-29
- Nereus 自适应并行运行时:RL 后训练 PPO 吞吐最高提升 7.27 倍 — Songlin Jiang · 2026-09-29