96GB 显存跑 Qwen3.8-Flash-Next:llama.cpp 调参实测 15t/s

HlddenDreck · reddit · 2026-09-09

Reddit 用户分享在 llama.cpp 中运行 Qwen3.8-Flash-Next(unsloth 的 GGUF UD-Q4KXL 量化版)的完整配置,重点讨论 96GB 显存下的部署细节:怀疑 embedding 未正确 offload 到内存,希望显式 offload 以减少性能损失。其配置要点包括 layer split-mode、开启 flash-attn、fit-ctx 262144、cache-ram 94208、top-p 0.95 / top-k 20(Qwen 推荐采样参数)。实测在 130k 上下文下生成速度约 15 t/s,prefill 100-200 t/s。帖子同时在征求其他人的设置对比,尤其关注 offload 行为。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →