Aleph Alpha 公开 MoE 预训练心得:16 到 512 块 B200 近线性扩展

CatAstro_Piyush · x · 2026-10-02

Aleph Alpha 发布博客,详解其分层预训练 scaling 方法:如何在不同 GPU 规模下做取舍,将一个 30B-A3B 的 MoE 模型从 16 块 B200 扩展到 512 块,全程保持 35% 的 MFU 并实现近线性扩展。对做预训练工程实践的团队有参考价值。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →