VLLM 在 Ampere 显卡上应使用 Flashinfer 后端

mayo551 · reddit · 2026-08-17

实测发现,在 Ampere 硬件上使用 VLLM 时,Flashinfer 是最佳 Attention 后端。相比 FA2 和 tritonattn,Flashinfer 在长上下文(超过 70k)时不会显著降速,且 MTP(Multi-Token Prediction)工作完美。在 4x3090 服务器上跑 Qwen 3.8 27B INT8 模型时,长上下文生成速度可达 100+ T/S。启动 VLLM 时需确认日志中显示使用了 FLASHINFER backend。此外,Gemma 模型需加 --language-model-only 参数以避免视觉模块阻止该后端运行。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →