单卡 RTX 5090 跑 Qwen3.8-27B 262K 上下文实测
Fz1zz · reddit · 2026-08-23
作者分享了在单张 RTX 5090 上运行 Qwen3.8-27B (NVFP4 量化) 的详细配置与性能数据。实测显示,在开启 FP8 KV 和前缀缓存的情况下,模型可在 32GB 显存中完整载入 262K 上下文,短上下文解码速度达 77 tok/s,128K 时降至 64.7 tok/s。前缀缓存带来了 22 倍的速度提升。
「Infra」频道最新
- ComfyUI Trellis 2 RDNA3/3.5/4 Windows 安装教程 — Wake_Up_Morty · 2026-08-23
- 开源项目 pgrok:自建 VPS 替代 ngrok — tom_doerr · 2026-08-23
- 数据中心反对声浪与 AI 行业扩张的矛盾 — NathanpmYoung · 2026-08-23
- RTX A6000 换硅脂装风扇,我终于敢跑模型了 — cephaloform · 2026-08-23
- 大神为 AMD GFX906 显卡优化了 llama.cpp — milpster · 2026-08-23
- Nvidia AI 服务器涨价超 15%,GB300 售价约 60 万美元 — zephyr_z9 · 2026-08-23