DeepMind 发布新书,系统解读 TPU 上 LLM 扩展与性能优化
TheZachMueller · x · 2026-08-24
Google DeepMind 团队发布了名为《How To Scale Your Model》的新书(在线阅读),旨在揭秘大规模语言模型扩展的科学。本书从系统视角出发,详细讲解了 TPU(及 GPU)的工作原理、硬件间通信机制以及 LLM 在真实硬件上的运行方式。
核心内容包括:
- 性能评估:如何判断模型各部分距离理论最优的差距,使用 Roofline 模型进行分析。
- 并行策略:在不同规模下(单卡到数万卡)如何选择数据并行、张量并行或流水线并行方案。
- 成本估算:预估训练和部署大模型所需的显存、时间和经济成本。
- 算法与硬件协同:如何利用特定硬件特性设计算法,以及针对算法瓶颈设计硬件。
本书假设读者具备 LLM 和 Transformer 架构的基础知识,适合希望深入理解底层优化和扩展机制的工程师阅读。
「Infra」频道最新
- 实测双 3060 跑通 LTX-2.5 22B LoRA 训练 — Ok-Beautiful-3479 · 2026-08-24
- Neocloud算力承购合同2026年前已超2500亿美元 — AccBalanced · 2026-08-24
- 美AI数据中心引发暴力威胁,共和党视其为选举风险 — rohanpaul_ai · 2026-08-24
- OpenAI 高管:马斯克赢在把硬件设计做到材料层 — hsu_byron · 2026-08-24
- Cerebras 和 SRAM 确立了存储层级的地位 — AccBalanced · 2026-08-24
- Minimax H3 社区新闻汇总:ComfyUI 节点与 AMD 训练支持 — optimisticalish · 2026-08-24