单张 RTX 5090 跑 Qwen3.8 Flash Next:靠 expert caching 达 50 t/s
dir3ctly · reddit · 2026-09-20
一位 Reddit 用户分享用 FreeToken 在单张 RTX 5090 上本地运行 Qwen3.8 Flash Next 的实测:文本生成约 50 t/s(40-60 浮动),prefill 约 2300 t/s,长上下文下依然稳定。
- 起因:llama.cpp 至今未合入 MoE 的 Expert Caching(多个 PR 讨论中),默认性能令人失望。
- 方案:改用开源项目 FreeToken,其 expert caching 让单卡性能达到可用水平。
- 帖子给出了完整启动参数:--moe-strategy auto --moe-cache-auto --expert-load parallel、229376 的 --max-seq-len-override 等,模型用 nvidia/Qwen3.8-Flash-Next-NVFP4(需转成 FreeToken 格式否则启动慢)。
- 硬件:RTX 5090 + 128GB DDR5 6000(96GB 也够)。
- 该方法适用于其他 MoE 模型,项目仍早期:刚支持 vision,尚无 KV 量化与 MTP。
「Infra」频道最新
- 端侧推理项目 Cactus Needle 登上 Hugging Face 热门榜 — Cactus-Compute · 2026-09-20
- 数据中心真的没交税?Tax Foundation 数据给出各地税率对比 — AndyMasley · 2026-09-20
- AMD 为 Kimi-K3 做重磅软件优化,国产模型硬件适配提速 — AccBalanced · 2026-09-20
- 内存价格半年从350涨到640美元,个人换机越来越难 — chrisalbon · 2026-09-20
- NVIDIA 工程师详解 DeepSeek V4.1 Flash 为速度重构架构 — thursdai_pod · 2026-09-20
- 140 美元捡漏 AMD MI50:老平台加卡跑 30B 模型提速近 9 倍 — tabletuser_blogspot · 2026-09-20