Aleph Alpha 公开 MoE 预训练心得:16 到 512 块 B200 近线性扩展
CatAstro_Piyush · x · 2026-10-02
Aleph Alpha 发布博客,详解其分层预训练 scaling 方法:如何在不同 GPU 规模下做取舍,将一个 30B-A3B 的 MoE 模型从 16 块 B200 扩展到 512 块,全程保持 35% 的 MFU 并实现近线性扩展。对做预训练工程实践的团队有参考价值。
「Infra」频道最新
- a16z 列出未来 5 年七条主线:Agent、机器人、自动驾驶、AI×生物科技等 — FinanceYF5 · 2026-10-02
- AI 基建投入占 GDP 已超当年铁路,但仅 30% 标普 500 量化披露 AI 影响 — FinanceYF5 · 2026-10-02
- 全双工语音推理成本虚高 56 倍,自研引擎实现单卡 H100 并发 56 路 — Ok_boss_labrunz · 2026-10-02
- Cloudflare 推出 SQL API:Workers 日志与追踪可直接用 SQL 查询 — irvinebroque · 2026-10-02
- Cloudflare 推出 AI Gateway Web Search API,统一接入三家搜索商 — michellechen · 2026-10-02
- Zig 从零写的机器浏览器 Lightpanda 1.0 正式发布 — jedisct1 · 2026-10-02