vLLM 原班人马创业公司用 16 块 TPU 跑 Kimi K3,比 GB200 快 57%
量子位 · wechat · 2026-09-26
推理创业公司 Inferact(vLLM 原始团队创办,a16z 领投 1.5 亿美元种子轮、估值 8 亿美元)发布 megakernel 方案:16 块 Google TPUv7 跑 Kimi K3 达到每秒 709 token,比同配置 16 块 GB200(452 token/s)快 57%,代码已开源。要点:
- 同条件对照:同样 16 芯片、同样 vLLM、同样模型,唯一变量是芯片与 kernel。关推测解码后裸速差距近一倍(249 vs 127 token/s);Qwen3-827B 上差距更大(1515 vs 695)
- 精度无损:greedy decoding 下 GPQA-Diamond 94.4%、GSM8K 97.2%,与 GPU 完全一致
- megakernel 原理:推理瓶颈在数据搬运而非计算;传统方案拆成几百个小 kernel,交接间隙浪费带宽。Inferact 用 Pallas 手写,把 K3 的 92 层 MoE 塞进一个程序,消除 kernel 边界,实现跨层权重预取,带宽几乎无空转
- 硬件巧合:TPU 的 64MiB 软件管理 VMEM 天然适合这种编排;GB200 片上内存 38MiB 由硬件调度,且 HBM 带宽(8000GB/s)反而更高,输在软件层
- 编译耗时从 XLA 的 30 分钟以上降到 90 秒内;当前为 K3 定制,将扩展到更多架构
该工作来自 Inferact 与 Google Cloud 的联合工程合作,目标是让 TPU 成为 vLLM 一等公民。
「Infra」频道最新
- 图表估算:LLM 实验室与超大规模云厂商间或有 6.5 万亿美元负债 — AIFlow_ML · 2026-09-26
- 128GB 本地 LLM 服务器月跑 8000 万 Qwen3 生成 token,电费仅 6 美元 — No-Fuel-9202 · 2026-09-26
- 社区投票:584 票选出 Apple Silicon 上最流行的 MLX 引擎,oMLX 以 57% 居首 — andrejusb · 2026-09-26
- 四大巨头 AI 资本开支达 GDP 2.4%,超当年电信泡沫峰值两倍 — deedydas · 2026-09-26
- Vitalik 设想本地跑 Qwen 加全量维基数据,顺带解决以太坊节点去中心化 — DavideCrapis · 2026-09-26
- 按黄仁勋 1GW 等于 1000 亿美元的口径,算力账要出问题? — AIFlow_ML · 2026-09-26