128GB 内存+单张 5080 跑 Qwen3.8 Flash Next,实测 136pp/19tg

whatyathinkk · reddit · 2026-09-15

楼主分享了在 128GB 内存 + 一张 5080(16GB)上跑 Qwen3.8 Flash Next 的量化配置与实测:Unsloth 的 Q5KXL 达 136pp/19tg,Q4KXL 为 152pp/23tg,Q3KXL 达 195pp/23tg,速度偏慢但质量令他惊喜。

配置要点:6 个分片的 GGUF(UD-Q5KXL-ncmoe48),lazy-mode 开启、ngl=999 全层上卡、n-cpu-moe=48 把 MoE 层留在 CPU、perlayertokenembd 强制 token embedding 走 CPU、262K 上下文、K/V 缓存均用 q80、flash-attn 开启;采样参数 temp=1.0/top-k=20/top-p=0.95,并保留 thinking 输出、reasoningeffort 设为 medium。楼主还附完整 llama.cpp 配置文件,询问是否有 MTP 等进一步提速手段。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →