Google DeepMind 团队发布《如何扩展模型》技术书
philhchen · x · 2026-08-18
Google DeepMind 团队发布了新书《How To Scale Your Model》,从系统工程视角深入解析 LLM 在 TPU/GPU 上的运作原理。内容涵盖 Roofline 模型分析、设备间通信机制、训练与推理的并行化策略(如 AllGather),以及如何估算训练成本和内存需求。该书旨在将模型性能优化从“炼金术”转化为可理解的科学,适合希望掌握大规模模型部署与优化的开发者。
「Infra」频道最新
- OCP 硅光架构愿景被吐槽:每 token 能耗逼近 1 焦耳 — jwt0625 · 2026-08-18
- OpenRouter 年度 token 用量从 3.73T 暴涨至 75T 以上 — scaling01 · 2026-08-18
- 传 Crusoe 寻求 IPO,估值或达 350 亿美元 — nwilliams030 · 2026-08-18
- MiniMax H3 动态工作流:16GB 显存跑 4 秒步数 — DaExChef · 2026-08-18
- ComfyUI 更新后 MiniMax H3 生成质量严重下降 — ASK_ABT_MY_USERNAME · 2026-08-18
- 网友拟开放 Qwen 3.8 27B 本地服务,每秒 56 Token — No_Run8812 · 2026-08-18