RTX 5090单卡跑Qwen3.8-27B NVFP4:vLLM+256K上下文,147 tok/s

AIFlow_ML · x · 2026-08-16

MiaAI-Lab发布脚本,在单张RTX 5090(32GB)上通过vLLM 0.27.x运行Qwen3.8-27B NVFP4模型,支持原生256K上下文、TurboQuant 4-bit KV缓存(5.5 GiB)和MTP-3投机解码,并暴露OpenAI兼容API。实测单流生成约160 tok/s(MTP-3),完整262,144 token上下文驻留,内置补丁修复了stock 0.27.1的乱码问题(0/15失败 vs 13/15)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →