VLLM 在 Ampere 显卡上应使用 Flashinfer 后端
mayo551 · reddit · 2026-08-17
实测发现,在 Ampere 硬件上使用 VLLM 时,Flashinfer 是最佳 Attention 后端。相比 FA2 和 tritonattn,Flashinfer 在长上下文(超过 70k)时不会显著降速,且 MTP(Multi-Token Prediction)工作完美。在 4x3090 服务器上跑 Qwen 3.8 27B INT8 模型时,长上下文生成速度可达 100+ T/S。启动 VLLM 时需确认日志中显示使用了 FLASHINFER backend。此外,Gemma 模型需加 --language-model-only 参数以避免视觉模块阻止该后端运行。
「Infra」频道最新
- Cerebras 扩张算力版图:签约超 600MW,制造产能将增 10 倍 — Sethwinterroth · 2026-08-17
- SK Hynix 拟 2027 年前大连工厂产能提升 50% — Beth_Kindig · 2026-08-17
- Cursor 运行 10 个 Bot 每月算力成本或高达 900 美元 — Daniel_Farinax · 2026-08-17
- QVM 支持超低延迟桌面流,适配三大系统 — OwariDa · 2026-08-17
- Groq 融资 3.5 亿美元,估值达 35 亿美元 — dinabass · 2026-08-17
- llama.cpp 发布 v0.1.0 版本,启用语义化控制 — Warrenio · 2026-08-17