自建 vLLM INT8 推理栈:4 张 MI100 跑 Qwen 27B 达 972 tok/s

1ncehost · reddit · 2026-08-27

开发者针对不支持原生 FP8 的老款显卡发布了一套完整的 INT8 推理方案:基于 vLLM、AITER 和 GPTQ INT8 量化(DFlash2),为 Qwen3.8 27B 在 4× MI100(整机约 6500 美元)上实现 972 tok/s 生成 / 5,680 tok/s 预填充,而原版 vLLM 仅约 15 tok/s。

具体工作包括:

质量验证极为严格:不只逐 token,还对每个 GEMM、注意力块、KV 查找和每层测量 KLD,诊断脚本保留在分支中可供自行验证。作者建议检查显卡的 INT8 TOPS 是否超过 FP8 FLOPS——若是,这套方案就适用;Triton 回退实现是硬件无关的,MI50/MI210 等老卡也能受益。项目已开源(vLLM/AITER 分支 + Hugging Face 上的量化模型)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →