Sail Research 把 Gemma 4 31B 在 TPU v6e 上的 MFU 从 32% 提到 63%
xennygrimmato_ · x · 2026-09-23
Sail Research 详细复盘了在 Google TPU v6e 上服务 Gemma 4 31B 的优化过程,把 prefill 的 MFU 从约 32% 提升到约 63%,并开源了内部性能建模工具 HTDYM(How to Deploy Your Model),用于评估在哪些芯片上部署模型最划算。
文章先拆解 v6e 的特殊性:BF16 FLOPs 与 H100 相当,但 HBM 少 2.5 倍、内存带宽不到一半;片间互联(ICI)也不如 NVLink 全互联,2x2 拓扑下 4 芯片成环,官方带宽数字难以直接对比,实测单机 AllGather 有效带宽约 180 GB/s 量级。
核心结论是:取决于模型,小众/专用加速器往往能以大幅折扣提供接近大厂平台的性能,Gemma 4 31B 正是适配 v6e 的典型案例。
「Infra」频道最新
- DarkbloomAI 付费一个月:日处理 token 从 4B 涨到 20B+ — gajesh · 2026-09-23
- InP 膜上硅光子电路:移相静态功耗低至 29 飞瓦 — jwt0625 · 2026-09-23
- 硅光芯片晶圆照片引热议:InGaAsP 异构集成相位调制器如何划片 — jwt0625 · 2026-09-23
- 燃气轮机订单排到 2030 年,涨价 195%,补电远水难解近渴 — FinanceYF5 · 2026-09-23
- 2026 年数据中心新增 18GW 需求,算完仍缺约 5GW — FinanceYF5 · 2026-09-23
- 大摩:美国数据中心缺电相当于六个纽约市 — FinanceYF5 · 2026-09-23