Google DeepMind 免费放出 LLM 扩展教程《How to Scale Your Model》并新增 GPU 章节
mdancho84 · x · 2026-09-26
Google DeepMind 团队(Jacob Austin、Sholto Douglas、Roy Frostig 等)撰写的免费在线书《How to Scale Your Model》系统讲解 LLM 在 TPU/GPU 上的扩展原理,最新更新到第 12 部分「How to Think About GPUs」。
全书内容包括:
- 硬件基础:Roofline 模型、TPU/GPU 如何工作与互联通信
- LLM 在真实硬件上的运行原理
- 训练与推理时的并行策略(如何切分计算到多设备)
- 实用估算:训练一个 LLM 要多少钱、自部署模型需要多少显存、AllGather 等集合通信概念
作者目标是用相对简单的原理解开「LLM 扩展像炼金术」的迷思,帮助读者判断模型距离理论最优多远、设计算法与硬件。适合了解 Transformer 与 LLM 训练基础、最好略懂 JAX 的读者。原帖作者同时附上了完整指南入口。
所属事件:DeepMind 免费开放《How to Scale Your Model》并新增 GPU 章节(2 条相关)→
「Infra」频道最新
- OpenAI Ultrafast API 将扩大开放,速度最高 750 tokens/秒 — testingcatalog · 2026-09-26
- Anthropic 7年116亿美元押注 Akamai 边缘推理,深度拆解 AI Grid 架构 — pdamodaran · 2026-09-26
- MLXUI 开源:按内存筛选一键装模型,Mac 本地跑全模态 AI — WebAssemblyMan · 2026-09-26
- 因 LPDDR4X 疑似短缺,三星最低端手机也改用 LPDDR5 — zephyr_z9 · 2026-09-26
- 双 GB10 集群调优 GLM-5.3-Flash:32k 预填充提速 20% — EAccelerate_42 · 2026-09-26
- CLM-8B 移植 MLX:冻结 Qwen3 编码器,Mac 本地 336 tok/s 出类型化答案 — WebAssemblyMan · 2026-09-26