2x3090 跑 Qwen3.8-Flash-Next:expert cache 把解码从 17 提到 25-29 t/s

Extension-Bid-639 · reddit · 2026-09-03

Reddit 用户分享了在廉价硬件上跑 Qwen3.8-Flash-Next 的详细优化数据。

硬件与配置

优化结果

核心技术:llama.cpp PR #27861 的 GPU 驻留 LRU expert cache

作者实测无效甚至有害的项:线程数/poll/CPU mask、q8 KV、lazy PLE、散文上的 n-gram drafts、temp 0.7 下的 MTP(只在 greedy 或深上下文有收益)、每步超过 2 次 cache 上传(打满 PCIe 3.0,命中率崩塌)。

可复现:帖子给出完整命令——拉取 llama.cpp master 并 merge PR #27861,用 --moe-expert-cache 等参数启动;cache 容量按 KV 与计算缓冲之外的剩余显存来定,Q6 下约每 slot 每卡 100MB。作者计划下一步测 UD-Q4KXL。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →