Google DeepMind 推出免费在线书《How To Scale Your Model》讲透 TPU 上 LLM 扩展
goyal__pramod · x · 2026-09-05
Google DeepMind 团队(Jacob Austin、Sholto Douglas、Roy Frostig 等)于 2025 年 2 月发布系列在线书《How To Scale Your Model》,系统讲解 LLM 在 TPU(及 GPU)上的运行与扩展原理。
- 内容覆盖:加速器工作原理与互连通信、Roofline 性能模型、训练与推理的并行策略(如 AllGather 等集合通信)、以及如何估算训练成本与显存需求。
- 实用目标:帮读者判断模型离理论最优有多远、在不同规模下选择并行方案、估算自托管模型的硬件需求。
- 定位:把「炼丹式」的性能优化拆解为可复用的简单原则,从单卡到上万卡规模均适用。
- 前置要求:了解 Transformer 与 LLM 训练基础,最好有 JAX 基础。
「Infra」频道最新
- AMD 携手 Cisco 与沙特 HUMAIN 部署 MI335X 集群,规划 250MW — Beth_Kindig · 2026-09-05
- Reef 发布推理原生基础设施:自改进 Agent 边学习边不间断服务 — pliang279 · 2026-09-05
- 从 1D 到 2D int8 量化 GPU kernel,博主分享底层性能跃升 — goyal__pramod · 2026-09-05
- 开发者优化 MoE 内核:BF16 提速 1.2 倍,MXFP8 提速 1.6 倍 — retr0jirachi · 2026-09-05
- 显卡能跑多少 token/s?一条显存带宽公式帮你估算上限 — Pyrolistical · 2026-09-05
- Google Cloud 用 Cloud Run 沙箱破解编码 agent「修复循环」难题 — rseroter · 2026-09-05