TPU 推理 megakernel 开源:Kimi K3 达 709 tokens/s 超 GB200
vllm_project · x · 2026-09-24
inferact 团队开源了据称是首个 TPU 推理 megakernel,让 Kimi K3 在低并发解码下达到 709 tokens/s,对比 GB200 基线的 450 tokens/s(均用 DSpark 投机解码)。K3 全部 92 层 MoE 在单个 Pallas kernel 中运行,权重预取跨层边界,使一层的数据传输与前一层计算重叠。不开投机解码时,batch size 1-8 下约为 GB200 基线的 1.4-2 倍。vLLM 官方账号转发了该成果。
「Infra」频道最新
- 高通与 Liquid AI 对谈:软硬件协同设计端侧 AI 与智能体 — samcharrington · 2026-09-24
- Zilliz CTO:Agent 让企业数据层问题无处遁形 — No_Engineer_1224 · 2026-09-24
- $0.072/时的16GB云VM跑Android模拟器+Chrome,常驻Agent工作流新选择 — cem2ran · 2026-09-24
- NVIDIA DGX Spark 一机难求,网友称将再也买不到 — GabGarrett · 2026-09-24
- 不是所有 AI 任务都需要 LLM:小型分类决策可省时省成本 — bigdata · 2026-09-24
- Prime Intellect 开源级发布 Prime Sandboxes:面向 RL 训练的 MicroVM 沙箱 — xeophon · 2026-09-24