双 3090 跑 Qwen3.8 Flash Next:llama.cpp 配置求调优,附完整参数

ChopSticksPlease · reddit · 2026-09-12

作者分享在双 RTX 3090(48GB 显存)+ 128GB DDR4 + 40核 Xeon(Proxmox 虚拟机、PCIe 直通、NUMA 绑定)上跑 Qwen3.8 Flash Next 的 llama.cpp 配置,并征求改进建议。

当前成绩:PP 130-200 tps(疑似 CPU 瓶颈)、TG 约 14-22 tps(平均约15)。关键参数包括 131072 上下文、q80 KV cache、flash-attn、-ts 26,10 层分配、-ncmoe 26、perlayertokenembd=CPU 张量覆盖等,手动调参以避免崩溃。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →