SemiAnalysis 实测 TPU 推理性价比:每美元性能领先 B200 达 50%、B300 近 96%
新智元 · wechat · 2026-09-10
SemiAnalysis 发布谷歌第七代 TPU Ironwood 的首份第三方推理性能测算:在同款开源模型、FP8 对 FP8、输入 8k 输出 1k 的对等负载下,TPU 每美元性能最高领先英伟达 B200 约 50%,对 B300 领先近 96%。
关键数据
- 单用户 100 token/s 吞吐基准下,TPU 比 B200 便宜 19%、比 B300 便宜 34%
- 每百万 token 成本:TPU 0.181 美元,B200 0.222 美元,B300 0.276 美元
- 按谷歌内部 1.03 美元/芯片·小时的 TCO 口径,性价比优势放大至 77%–130%
工程细节:Ironwood 拆为双计算 Die、HBM 为上代 6 倍、原生 FP8;KV Cache 页数翻倍后中位首 Token 延迟骤降 95%;读取/计算块拆分解码吞吐从 64.9k 提至 96.3k token/s;ReduceScatter 与 MoE 重排转移至 SparseCore,最高吞吐提升 26.1%。
生态破壁:TorchTPU 通过 PyTorch PrivateUse1 后端绕过 TorchAX 翻译墙,vLLM/SGLang 可直接复用调度器与 API 层,Pallas 内核可空降。文章还指出黄仁勋 4 月播客中「TPU 不敢跑分」「Anthropic 是特例」的断言正被逐条推翻——Anthropic 已吞下超 100 万颗 TPU(约 40 万买断、60 万租赁),到 2029 年将成全球最大 TPU 单一用户。
「Infra」频道最新
- DeepSeek 发布 V4.1-Flash:百万 token 上下文,KV 缓存缩小 4 倍 — matlabulous · 2026-09-11
- 8GB 显存还能干嘛?网友求解小模型现状与推荐 — riceinmybelly · 2026-09-11
- 西班牙新规要求 80% 逐小时绿电匹配,数据中心建设或耗资千亿欧元 — eherrerosj · 2026-09-11
- Draghi 引用 ECB 研究:AI 或每年提振欧洲生产率 0.3-0.4 个百分点 — rohanpaul_ai · 2026-09-11
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11
- 斯坦福论文:本地+云端混合路由可省 60%-80% 算力成本 — rohanpaul_ai · 2026-09-11