Aleph Alpha 揭秘:768 块 B200 上预训练 30B MoE 模型实现近线性扩展
bodonoghue85 · x · 2026-10-05
Aleph Alpha 发布技术博客《Scaling Pre-Training in Practice: A Hierarchical Approach》,详细拆解如何把一个 30B-A3B MoE 模型的预训练从 16 块 B200 GPU 扩展到 512 块,达到 35.3% MFU,仅比完美线性扩展低 6%。
核心方法:用分层(hierarchical)策略先在小规模 GPU 上缩小超参搜索空间,再逐步增加 GPU 数量,避免在 512 卡上做昂贵的天真网格搜索。文中强调:单纯“买更多 GPU”不能提升训练效率,软件栈不经精细调优,效率会快速退化;前沿实验室正是靠投入大量人力和 agent 时间去优化训练栈,追逐几个百分点的效率提升。
作者还透露:博客未完全展开的细节,其 30B MoE 架构正是随后发布的开源权重模型 Kolibri Origin。即使只有 1-2 块 GPU 的开发者,也可以借鉴这套优化哲学提升 GPU 利用率。
「Infra」频道最新
- AI 基建陷入死循环:云厂商 1830 亿美元收入七成依赖亏损的 OpenAI 与 Anthropic — churchkey · 2026-10-05
- 开发者推出 Otis 代理:自动配置 llama.cpp,统一本地与云端推理 — Objective-Pair8231 · 2026-10-05
- CostGraph 推出 GPU 跟踪功能:算力服务商可按卡归属计费 token 用量 — saheedniyi_02 · 2026-10-05
- 用 Magpie CLI 查额度,按重要紧急度调度 sub agent 省 token — lxfater · 2026-10-05
- AI 竞争新瓶颈:买得到 GPU 买不到电网,并网千兆瓦成战略资产 — ingliguori · 2026-10-05
- AI 使用便宜、提供昂贵,投资人称计算补贴时代该结束了 — Kyrannio · 2026-10-05