2x3090 跑 Qwen3.8-Flash-Next:expert cache 把解码从 17 提到 25-29 t/s
Extension-Bid-639 · reddit · 2026-09-03
Reddit 用户分享了在廉价硬件上跑 Qwen3.8-Flash-Next 的详细优化数据。
硬件与配置
- 2x RTX 3090(PCIe 3.0)+ 双 Xeon E5-2696 v4 + 188GB DDR4-2133
- llama.cpp + unsloth UD-Q6KXL,全部 48 个 expert 层驻留主机内存,261k 上下文、f16 KV
优化结果
- 解码速度:17 t/s → 25-29 t/s(短/中上下文),131k 深度下 17 t/s
- prefill 约 350 t/s(26k prompt),基本不变
核心技术:llama.cpp PR #27861 的 GPU 驻留 LRU expert cache
- 不把整层 expert 放进显存,而是按层缓存最近使用的 experts——相邻 token 选中的 experts 大部分相同,代码场景命中率 80-85%,散文更高
- 关键技巧:给 cache 让出显存,同时把 ubatch 从 2048 降到 512(计算缓冲随之缩小,每卡省 5GB),使每层 slot 从 80 提到 135
- 代价:长 prompt 的 prefill 变慢,短 prompt 不受影响
作者实测无效甚至有害的项:线程数/poll/CPU mask、q8 KV、lazy PLE、散文上的 n-gram drafts、temp 0.7 下的 MTP(只在 greedy 或深上下文有收益)、每步超过 2 次 cache 上传(打满 PCIe 3.0,命中率崩塌)。
可复现:帖子给出完整命令——拉取 llama.cpp master 并 merge PR #27861,用 --moe-expert-cache 等参数启动;cache 容量按 KV 与计算缓冲之外的剩余显存来定,Q6 下约每 slot 每卡 100MB。作者计划下一步测 UD-Q4KXL。
「Infra」频道最新
- RTX 5090 夜间自动生成股市简报,数字门禁杜绝 LLM 编造数据 — JakeChj · 2026-09-03
- Counterpoint:长鑫存储 Q2 DRAM 市占率达 10% — zephyr_z9 · 2026-09-03
- 开源 RL 框架 Miles 发布:面向企业级 LLM/VLM 后训练 — AravSrinivas · 2026-09-03
- 跑模型其实是跑内核:推理性能差距藏在 fused kernel 里 — EAccelerate_42 · 2026-09-03
- KAIST 提出 Declarative Attention,让模型自选跳读 KV 缓存 — kaist-ai · 2026-09-03
- 全职妈妈拍家务日赚 120 元:机器人数据众包产业调查 — 创业邦 · 2026-09-03