NVIDIA BioNeMo 实测:MoE 生物基础模型训练吞吐最高提升 2.21 倍
AllThingsApx · x · 2026-10-01
NVIDIA 技术博客介绍如何用 BioNeMo 配方加速生物基础模型的 MoE 训练:
- GroupedLinear:将多个 expert GEMM 合为一次 grouped 操作提交,消除 Python 循环逐 expert 启动 kernel 的开销。
- MXFP8 8-bit 块缩放精度:相比 BF16 显著省内存,Blackwell GPU 硬件加速。
- Sequential API 融合:把 GroupedLinear、ScaledSwiGLU 与路由权重缩放融合为单一 kernel,避免中间物化。
- 实测:在 8 张 B200 上,吞吐量最高达 Hugging Face 基线的 2.21 倍。
博客附 Mixtral Native Transformer Engine 配方,可直接照做训练 MoE 生物模型。
所属事件:NVIDIA BioNeMo 优化 MoE 训练,吞吐较 HF 基线最高提升 2.21 倍(3 条相关)→
「Infra」频道最新
- Cloudflare 生日周第三天:Agent 主题连发六项新功能 — threepointone · 2026-10-01
- 分布式算力市场新上 10 个 B300 节点,可按单节点起租 — markjeffrey · 2026-10-01
- 27B 模型 Q5 量化+131k 上下文塞进单张 24GB 3090,提速 13-17% — bjivanovich · 2026-10-01
- netkit 论文:容器网络跨 namespace 吞吐损失高达 31% — tianyin_xu · 2026-10-01
- 开发者搞定 PCIe 组网,即将上线 6 卡 GPU 本地算力 — TheZachMueller · 2026-10-01
- Ben Bajarin 吐槽行业乱象:scale-out 与 scale-up 定义各家不一 — BenBajarin · 2026-10-01