12GB 显存跑通 Qwen3.8-Flash-Next 125B MoE,MTP 加持逼近 21 tok/s

carteakey · reddit · 2026-09-15

作者在 RTX 4070 12GB + 64GB DDR5-5600 + Gen4 NVMe 的 Linux 机器上跑 Qwen3.8-Flash-Next(125B-A6B MoE + 51B n-gram 表),从最初 6 tok/s 优化到接近 20 tok/s,认为这是该配置下能做到的最强智能。作者称其多数任务上超过 27B 稠密模型,适合低显存高内存配置。

关键做法:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →