128GB Strix Halo 跑 Qwen3.8 Flash:Q4+Q8 n-gram 混合量化的内存账与困惑度实测
MarkoMarjamaa · reddit · 2026-09-10
作者在 128GB AMD Strix Halo 上极限尝试运行 Qwen3.8-Flash-Next 的高精度量化版本,并记录了完整的内存开销数据:mmproj 约 +1GB;MTP 文件 2.8GB 实占 5.5GB;KV-cache 在 f16 下每 10000 tokens 占 1GB,q8 下每 20000 tokens 占 1GB。
模型体积方面:Q4KXL 为 77GB,Q5KXL 达 108GB(比 Q4 大 31GB)。作者发现 n-gram 文件只从磁盘读取,不影响内存占用,于是将 Q4 的 n-gram 换成 Q5 的 Q8 n-gram(25GB),以此弥补 Q4 的精度损失。搭配 mmproj、MTP 和 64000 q8 KV-cache 时内存仅剩 1-2GB 余量,机器上还需跑 STT/TTS,最终只能放弃 Q5。
困惑度对比(以 Q8 为基准):Q5KXL 的 Top-1% 为 94.795、Mean KLD 0.0182;Q4+25GB n-gram 为 93.286/0.0334;Q4+50GB n-gram 为 93.786/0.0279。结论:Q8 n-gram 配 Q4 不是质变,但方向正确;作者计划寻找介于两者之间、比 Q4 大 10-15GB 的 Q5M/XS 变体,并补测 F16 基准。
「Infra」频道最新
- Epoch 估算:OpenAI 两年算力增长约 17 倍 — FlorianGallwitz · 2026-09-10
- 手把手教程:用 Google Cloud Run 沙箱安全运行不可信代码 — rseroter · 2026-09-10
- TrendForce 预测英伟达 2027 年 NVL72 机架出货增超 50%,三大产品线营收超 7100 亿美元 — Beth_Kindig · 2026-09-10
- 隐身 7 年的 Kepler 出关:做超越 HBM 的 AI 内存,获 2.45 亿美元政府支持 — npinto · 2026-09-10
- Radium 自购 GPU 低价对标 OpenAI/Anthropic,困惑为何小客户不买账 — No_Raspberry7273 · 2026-09-10
- 8GB 显卡跑 130M 模型 100 万步不崩:自适应显存调度器实验 — uBazzyZ- · 2026-09-10