128GB 内存+单张 5080 跑 Qwen3.8 Flash Next,实测 136pp/19tg
whatyathinkk · reddit · 2026-09-15
楼主分享了在 128GB 内存 + 一张 5080(16GB)上跑 Qwen3.8 Flash Next 的量化配置与实测:Unsloth 的 Q5KXL 达 136pp/19tg,Q4KXL 为 152pp/23tg,Q3KXL 达 195pp/23tg,速度偏慢但质量令他惊喜。
配置要点:6 个分片的 GGUF(UD-Q5KXL-ncmoe48),lazy-mode 开启、ngl=999 全层上卡、n-cpu-moe=48 把 MoE 层留在 CPU、perlayertokenembd 强制 token embedding 走 CPU、262K 上下文、K/V 缓存均用 q80、flash-attn 开启;采样参数 temp=1.0/top-k=20/top-p=0.95,并保留 thinking 输出、reasoningeffort 设为 medium。楼主还附完整 llama.cpp 配置文件,询问是否有 MTP 等进一步提速手段。
「Infra」频道最新
- OpenAI 访谈:内核优化让 GPT-5.6 Sol 服务成本降 20% — TheTuringPost · 2026-09-15
- Devin 接管 H100 自主实验:训练 kernel 峰值内存降 46%、延迟降 52% — AAAzzam · 2026-09-15
- 两大约束下 Mac 跑 AI 反超:统一内存大、无障碍服务助力 computer use — dotey · 2026-09-15
- 5 个生产应用月 200 万请求仅花 6 美元,Cloudflare 全家桶成本碾压 Vercel 组合 — viksit · 2026-09-15
- 3090+Arc B70 混插跑 LLM?Reddit 求解 56GB VRAM 混合方案 — overand · 2026-09-15
- Google Cloud 携手 Inferact:vLLM 将把 TPU 变为开源推理一等公民 — vllm_project · 2026-09-15