Aleph Alpha 揭秘:768 块 B200 上预训练 30B MoE 模型实现近线性扩展

bodonoghue85 · x · 2026-10-05

Aleph Alpha 发布技术博客《Scaling Pre-Training in Practice: A Hierarchical Approach》,详细拆解如何把一个 30B-A3B MoE 模型的预训练从 16 块 B200 GPU 扩展到 512 块,达到 35.3% MFU,仅比完美线性扩展低 6%。

核心方法:用分层(hierarchical)策略先在小规模 GPU 上缩小超参搜索空间,再逐步增加 GPU 数量,避免在 512 卡上做昂贵的天真网格搜索。文中强调:单纯“买更多 GPU”不能提升训练效率,软件栈不经精细调优,效率会快速退化;前沿实验室正是靠投入大量人力和 agent 时间去优化训练栈,追逐几个百分点的效率提升。

作者还透露:博客未完全展开的细节,其 30B MoE 架构正是随后发布的开源权重模型 Kolibri Origin。即使只有 1-2 块 GPU 的开发者,也可以借鉴这套优化哲学提升 GPU 利用率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →