双 5060 Ti 跑 Qwen3.8-Flash-Next 仅 10 t/s,楼主求解优化配置
MkGod · reddit · 2026-09-19
Reddit 用户在双 RTX 5060 Ti 16GB(共 32GB 显存)+ 96GB DDR4 上,通过 Unsloth Studio(llama-server 后端)运行 Qwen3.8-Flash-Next-UD-Q3KXL,寻求配置建议。
已尝试的配置:
- 专家卸载到 CPU:--cpu-moe -ngl 99 -b 1024 -ub 512 -fa on
- 65k 上下文窗口
- q40 KV cache
- MTP 推测解码(draft 接受率约 87%)
结果 decode 仅约 9.5–10 t/s,prefill 12–38 t/s。他注意到社区用双 3090 加新 expert-cache PR(#27861 / #28223)和锁定主机内存能跑到 25–40 t/s,但在自己的 32GB 显存 + DDR4 条件下不确定出路:是彻底弃用 MTP、用 --load-mode none 绕过 mmap,还是自编译带 LRU expert cache 的 llama.cpp?还是说本质上已被内存带宽卡死?
「Infra」频道最新
- 内罗毕首届 Cafe Compute 聚会演示 Cerebras,呼吁推理层可解释性 — paw_lean · 2026-09-19
- Cerebras 用 Qwen 27B 打造购房理财助手 Money Agent — Alibaba_Qwen · 2026-09-19
- GPU 出租遭租客利用发起攻击,Clore.AI 拒不处理还封号 — anomaly256 · 2026-09-19
- 3M 曾赔 103 亿美元弃产 PFAS,AI 数据中心又把它做成增长市场 — aakashgupta · 2026-09-19
- 随机删缓存也行?研究揭示KV Cache驱逐机制被高估 — 机器之心 · 2026-09-19
- $250 淘矿卡魔改 30GB 显存,老 i7 主机跑 Qwen 达 30 tok/s — HFq_Dev · 2026-09-19