96GB 显存跑 Qwen3.8-Flash-Next:llama.cpp 调参实测 15t/s
HlddenDreck · reddit · 2026-09-09
Reddit 用户分享在 llama.cpp 中运行 Qwen3.8-Flash-Next(unsloth 的 GGUF UD-Q4KXL 量化版)的完整配置,重点讨论 96GB 显存下的部署细节:怀疑 embedding 未正确 offload 到内存,希望显式 offload 以减少性能损失。其配置要点包括 layer split-mode、开启 flash-attn、fit-ctx 262144、cache-ram 94208、top-p 0.95 / top-k 20(Qwen 推荐采样参数)。实测在 130k 上下文下生成速度约 15 t/s,prefill 100-200 t/s。帖子同时在征求其他人的设置对比,尤其关注 offload 行为。
「Infra」频道最新
- RTX 3090 跑 27B 大上下文实测:131K 上下文约 25.6 tok/s — bjivanovich · 2026-09-09
- Polymarket:今年美国某州出台数据中心建设禁令概率达 73% — Polymarket · 2026-09-09
- 马斯克版图全面押注美国制造:Terafab 首期投资超 168 亿美元 — XFreeze · 2026-09-09
- Broadcom CEO 称开源模型烧千亿美元算力仅换三百亿收入 — zephyr_z9 · 2026-09-09
- 隐形创业公司 Kepler 出关:3D 堆叠新存储剑指 HBM 荒 — nordicinst · 2026-09-09
- Cloudflare 重写 Workers 模块注册表,全面对齐 Node.js 兼容性 — Cloudflare Blog · 2026-09-09