vLLM v0.30 性能细节:Gemma 4 多模态提速 3.23 倍
vllm_project · x · 2026-09-23
vLLM v0.30.0 官方线程的性能工作部分,列出多项可量化优化:
- RL 采样掩码:GPU 压缩让 512 请求下的吞吐恢复到无掩码的 2–3% 以内,修复约 2 倍的步时回退
- Kimi K3 混合批次:端到端吞吐提升 5.2–7.7%
- Gemma 4 多模态前缀:在 RTX PRO 6000 上端到端提速 3.23 倍
- AMD ROCm:packed W4A16 零点让 Gemma 4 AWQ 的中位 TPOT 降低 26.4%
- Arm CPU:Llama 3.1 8B W8A8 吞吐提升约 6%
所属事件:vLLM v0.30.0 发布:762 次提交带来多项性能优化(3 条相关)→
「Infra」频道最新
- tinygrad 在 MI300X 上跑出 MiMo-V2.6-Pro 约 200 tok/s — AIFlow_ML · 2026-09-23
- 爆料:64GB 版 RTX 5090 研发中,但短期内难上市 — AIFlow_ML · 2026-09-23
- Swarm 推出 Qwen Image-2.1 推理引擎:1K 图生成仅 0.5 秒 — bingxu_ · 2026-09-23
- MTP 头被静默忽略:修复三行代码让 Mac 本地解码提速 63%-79% — Micha0827 · 2026-09-23
- 开源自托管备份方案Pluton:Restic+Rclone加密备份跨云复制 — tom_doerr · 2026-09-23
- TensorSharp 直读 label logits,结构化决策比 LocalJev 快 3.3 倍 — fuzhongkai · 2026-09-23