魔改 vLLM 补丁把 Gemma 4 31B 推理提速至 150 tok/s,超越 SGLang 最佳成绩
abhijithneil · x · 2026-09-13
- 作者将 Gemma 4 31B 在单张 B300 GPU 上的吞吐从 46.7 tok/s(eager 基线)提升到 150 tok/s(非有损配置),超过 SGLang 最优的 139 tok/s
- 关键难点:Gemma 4 的十个全局层使用 headdim 512,多数 attention kernel 不支持——FlashInfer 在 SGLang 里可以路由处理,但 vLLM 的该路径最高只支持 headdim 256
- 作者 fork vLLM 并自行打补丁修复 headdim 256 上限,配合 FlashInfer 实现 vLLM+FlashInfer 组合 150 tok/s,超过 SGLang+FlashInfer 的 139 tok/s
- 博客文章即将发布
「Infra」频道最新
- Macrocosmos 推出 IOTA:把分散闲置算力聚合成训练能力 — markjeffrey · 2026-09-13
- 开发者上线 Lorivo:一张 GPU 共享服务上百个 LoRA 适配器 — TheOneWhoWil · 2026-09-13
- 日本 neocloud「ai&」宣称 CUDA 护城河已消失,大举部署 Tenstorrent 芯片 — DavidBennett__ · 2026-09-13
- Mac 本地跑模型:MLX 与 GGUF 该怎么选 — Ok_Warning2146 · 2026-09-13
- 「The Hugging Bay」上线:用 BT 种子下载开源模型权重 — csuwildcat · 2026-09-13
- Anthropic 算力承诺高达 5170 亿美元,远超此前披露的 1800 亿 — citrini · 2026-09-13