Sail Research 把 Gemma 4 31B 在 TPU v6e 上的 MFU 从 32% 提到 63%

xennygrimmato_ · x · 2026-09-23

Sail Research 详细复盘了在 Google TPU v6e 上服务 Gemma 4 31B 的优化过程,把 prefill 的 MFU 从约 32% 提升到约 63%,并开源了内部性能建模工具 HTDYM(How to Deploy Your Model),用于评估在哪些芯片上部署模型最划算。

文章先拆解 v6e 的特殊性:BF16 FLOPs 与 H100 相当,但 HBM 少 2.5 倍、内存带宽不到一半;片间互联(ICI)也不如 NVLink 全互联,2x2 拓扑下 4 芯片成环,官方带宽数字难以直接对比,实测单机 AllGather 有效带宽约 180 GB/s 量级。

核心结论是:取决于模型,小众/专用加速器往往能以大幅折扣提供接近大厂平台的性能,Gemma 4 31B 正是适配 v6e 的典型案例。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →