GLM-4.7 Flash 三种量化实测:MXFP4 预处理快 60%,Q4_K_XL 生成最快

tabletuser_blogspot · reddit · 2026-10-05

作者在 AMD Ryzen 7 6800H iGPU(Radeon 680M)+ 64GB DDR5 的迷你主机上,用 llama.cpp Vulkan 版对三个约 16-17GB 的 30B.A3B MoE 量化模型做了基准对比(3 次取均值):

| 量化格式 | 预处理 pp512 | 生成 tg128 |

|---|---|---|

| MXFP4MOE | 258.36 t/s | 11.66 t/s |

| Q4KM | 218.22 t/s | 12.09 t/s |

| Q4KXL | 160.31 t/s | 13.13 t/s |

关键发现:

结论:聊天/流式场景选 Q4KXL,长上下文/RAG 选 MXFP4MOE。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →