128GB Strix Halo 跑 Qwen3.8 Flash:Q4+Q8 n-gram 混合量化的内存账与困惑度实测

MarkoMarjamaa · reddit · 2026-09-10

作者在 128GB AMD Strix Halo 上极限尝试运行 Qwen3.8-Flash-Next 的高精度量化版本,并记录了完整的内存开销数据:mmproj 约 +1GB;MTP 文件 2.8GB 实占 5.5GB;KV-cache 在 f16 下每 10000 tokens 占 1GB,q8 下每 20000 tokens 占 1GB。

模型体积方面:Q4KXL 为 77GB,Q5KXL 达 108GB(比 Q4 大 31GB)。作者发现 n-gram 文件只从磁盘读取,不影响内存占用,于是将 Q4 的 n-gram 换成 Q5 的 Q8 n-gram(25GB),以此弥补 Q4 的精度损失。搭配 mmproj、MTP 和 64000 q8 KV-cache 时内存仅剩 1-2GB 余量,机器上还需跑 STT/TTS,最终只能放弃 Q5。

困惑度对比(以 Q8 为基准):Q5KXL 的 Top-1% 为 94.795、Mean KLD 0.0182;Q4+25GB n-gram 为 93.286/0.0334;Q4+50GB n-gram 为 93.786/0.0279。结论:Q8 n-gram 配 Q4 不是质变,但方向正确;作者计划寻找介于两者之间、比 Q4 大 10-15GB 的 Q5M/XS 变体,并补测 F16 基准。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →