自建 vLLM INT8 推理栈:4 张 MI100 跑 Qwen 27B 达 972 tok/s
1ncehost · reddit · 2026-08-27
开发者针对不支持原生 FP8 的老款显卡发布了一套完整的 INT8 推理方案:基于 vLLM、AITER 和 GPTQ INT8 量化(DFlash2),为 Qwen3.8 27B 在 4× MI100(整机约 6500 美元)上实现 972 tok/s 生成 / 5,680 tok/s 预填充,而原版 vLLM 仅约 15 tok/s。
具体工作包括:
- 为 MI100 全面调优的 W8A8 INT8 GEMM 库,并在全栈使用
- INT8 KV cache、INT8 AITER Unified Attention(带 Triton 回退,快于 Flash Attention)
- INT8 Mamba/GDN 注意力、INT8 Embedding
- 针对 XGMI 互连优化的 INT8 自定义 allreduce/allgather
- 多个新的融合 INT8 kernel
质量验证极为严格:不只逐 token,还对每个 GEMM、注意力块、KV 查找和每层测量 KLD,诊断脚本保留在分支中可供自行验证。作者建议检查显卡的 INT8 TOPS 是否超过 FP8 FLOPS——若是,这套方案就适用;Triton 回退实现是硬件无关的,MI50/MI210 等老卡也能受益。项目已开源(vLLM/AITER 分支 + Hugging Face 上的量化模型)。
「Infra」频道最新
- 5090 显卡运行 Qwen 27B 本地模型:配置参数与优化分享 — Rollingsound514 · 2026-08-27
- 报告:七州数据中心年耗3.4万亿加仑淡水,超三大城市12倍 — AndyMasley · 2026-08-27
- 分析师:若有剩余产能,英伟达会吞下英特尔全部份额 — BenBajarin · 2026-08-27
- Nvidia 预测 2028 财年收入增长 70%,远超分析师预期 — firstadopter · 2026-08-27
- 英伟达NVLink Fusion扩展NVHBM:带宽提升30%,Annapurna首发合作 — nordicinst · 2026-08-27
- NVIDIA 与 AWS 再合作:部署 200 万 GPU 推进智能体 AI — nvidia · 2026-08-27