SemiAnalysis 实测 TPU 推理性价比:每美元性能领先 B200 达 50%、B300 近 96%

新智元 · wechat · 2026-09-10

SemiAnalysis 发布谷歌第七代 TPU Ironwood 的首份第三方推理性能测算:在同款开源模型、FP8 对 FP8、输入 8k 输出 1k 的对等负载下,TPU 每美元性能最高领先英伟达 B200 约 50%,对 B300 领先近 96%。

关键数据

工程细节:Ironwood 拆为双计算 Die、HBM 为上代 6 倍、原生 FP8;KV Cache 页数翻倍后中位首 Token 延迟骤降 95%;读取/计算块拆分解码吞吐从 64.9k 提至 96.3k token/s;ReduceScatter 与 MoE 重排转移至 SparseCore,最高吞吐提升 26.1%。

生态破壁:TorchTPU 通过 PyTorch PrivateUse1 后端绕过 TorchAX 翻译墙,vLLM/SGLang 可直接复用调度器与 API 层,Pallas 内核可空降。文章还指出黄仁勋 4 月播客中「TPU 不敢跑分」「Anthropic 是特例」的断言正被逐条推翻——Anthropic 已吞下超 100 万颗 TPU(约 40 万买断、60 万租赁),到 2029 年将成全球最大 TPU 单一用户。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →