双 3090 跑 Qwen3.8-27B:vLLM 加 DFlash2 解码飙到 218 tok/s

xjx546 · reddit · 2026-08-19

Reddit 网友在 2× RTX 3090(PCIe Gen4、无 NVLink、修补 P2P、功耗锁 220/250W)上实测 Qwen3.8-27B 的推理性能,使用 vLLM v0.26.1rc1 + AutoRound INT4(group 128)+ DFlash2 draft 模型的投机解码方案:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →