NVIDIA 新方案:MoE 训练吞吐最高达 HF 基线 2.21 倍,B200 实测

AllThingsApx · x · 2026-09-29

NVIDIA 技术博客介绍面向生物基础模型的 MoE 高效训练方案(BioNeMo 团队),在 8 张 B200 上对比 Hugging Face BF16 基线,Mixtral-8x7B 训练吞吐最高提升 2.21 倍。

关键技术点:

作者附注:该工作不含湿实验数据,属训练工程方向。官方建议从 Mixtral Native Transformer Engine recipe 入手尝试。

所属事件:NVIDIA BioNeMo 优化 MoE 训练,Mixtral 吞吐提升 2.21 倍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →