GLM-4.7 Flash 三种量化实测:MXFP4 预处理快 60%,Q4_K_XL 生成最快
tabletuser_blogspot · reddit · 2026-10-05
作者在 AMD Ryzen 7 6800H iGPU(Radeon 680M)+ 64GB DDR5 的迷你主机上,用 llama.cpp Vulkan 版对三个约 16-17GB 的 30B.A3B MoE 量化模型做了基准对比(3 次取均值):
| 量化格式 | 预处理 pp512 | 生成 tg128 |
|---|---|---|
| MXFP4MOE | 258.36 t/s | 11.66 t/s |
| Q4KM | 218.22 t/s | 12.09 t/s |
| Q4KXL | 160.31 t/s | 13.13 t/s |
关键发现:
- 680M iGPU 不支持原生 FP4(fp4: 0),MXFP4 为运行时模拟,但 MoE 结构+极限量化仍大幅降低预处理计算与内存读取,配合 Flash Attention 预处理速度领先约 60%
- 生成速度纯受内存带宽约束(约 50-65 GB/s),Q4KXL 的量化布局对 RADV 驱动预取更友好,比 Q4KM 快约 13%
- 各次运行标准差极小(±0.02-0.06 t/s),结果稳定;Q4KXL 首次运行 PP 方差偏大系冷缓存
结论:聊天/流式场景选 Q4KXL,长上下文/RAG 选 MXFP4MOE。
「Infra」频道最新
- 高通骁龙将为 Meta 与 OpenAI 下一代 AI 助手提供算力 — ryanshrout · 2026-10-05
- 开源推理引擎 Spite:模型、GPU、算子三层全部模块化可插拔 — giveen · 2026-10-05
- 研究称仅5%芯片一次流片成功,重复流片或成定制芯片扩产真瓶颈 — ai · 2026-10-05
- 黄仁勋发布 Open Agent 安全平台:用独立软硬件层防止 AI Agent 越狱 — dl_weekly · 2026-10-05
- CPU 乱序投机撞上不支持的指令会怎样?lemire 亲证不会崩溃 — lemire · 2026-10-05
- LINKUP PCIe 5.0 延长线实测:满载稳定 Gen5 x16 不降速 — Mayhem4Markets · 2026-10-05