双 5060 Ti 跑 Qwen3.8-Flash-Next 仅 10 t/s,楼主求解优化配置

MkGod · reddit · 2026-09-19

Reddit 用户在双 RTX 5060 Ti 16GB(共 32GB 显存)+ 96GB DDR4 上,通过 Unsloth Studio(llama-server 后端)运行 Qwen3.8-Flash-Next-UD-Q3KXL,寻求配置建议。

已尝试的配置:

结果 decode 仅约 9.5–10 t/s,prefill 12–38 t/s。他注意到社区用双 3090 加新 expert-cache PR(#27861 / #28223)和锁定主机内存能跑到 25–40 t/s,但在自己的 32GB 显存 + DDR4 条件下不确定出路:是彻底弃用 MTP、用 --load-mode none 绕过 mmap,还是自编译带 LRU expert cache 的 llama.cpp?还是说本质上已被内存带宽卡死?

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →