Qwen3.8-27B 跑满 RTX 5090:NVFP4 量化实现 256 t/s 代码生成,支持 17.5 万上下文

pennyonaire · reddit · 2026-08-30

分享了在单块 RTX 5090 上运行 Qwen3.8-27B 的完整方案。该方案采用 Blackwell 架构特调配方,使用 NVFP4 量化(相当于 Q6)、sglang 引擎及 DFLASH2 推测解码。实测数据显示,代码生成速度可达 256 t/s(单槽)和 451 t/s(双槽并行),散文生成达 144 t/s。该配置支持 175k 上下文池,利用 Host-RAM KV 层技术,约 10 万 token 的对话恢复时间仅需约 1 秒。此外,方案通过量化 lmhead 和优化 KV 缓存节省显存,并给出了具体的调优参数(如 Spec tokens 大小)和性能评测数据(GPQA 84.8%)。作者还提供了一个请求代理小技巧,通过令牌计数管理请求队列,防止大请求阻塞并行槽位。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →