单卡 RTX 5090 跑 Qwen3.8-27B 262K 上下文实测

Fz1zz · reddit · 2026-08-23

作者分享了在单张 RTX 5090 上运行 Qwen3.8-27B (NVFP4 量化) 的详细配置与性能数据。实测显示,在开启 FP8 KV 和前缀缓存的情况下,模型可在 32GB 显存中完整载入 262K 上下文,短上下文解码速度达 77 tok/s,128K 时降至 64.7 tok/s。前缀缓存带来了 22 倍的速度提升。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →