Radeon 680M 核显跑 GLM-4.7:三种量化格式实测对比

tabletuser_blogspot · reddit · 2026-08-19

在 Acemagic 迷你主机(Ryzen 7 6800H + Radeon 680M 核显,64GB DDR5,Ubuntu + llama.cpp Vulkan)上实测 GLM-4.7-Flash 的三种量化(GGUF 头显示实为 deepseek2 30B.A3B MoE 架构):MXFP4 MoE(15.79GiB)、UD-Q4KXL(16.31GiB)、Q4KM(17.05GiB)。

结果(3 次平均,Flash Attention 开启):

| 格式 | 提示处理 pp512 | 生成 tg128 |

|---|---|---|

| MXFP4 MoE | 258.36 t/s | 11.66 t/s |

| Q4KM | 218.22 t/s | 12.09 t/s |

| UD-Q4KXL | 160.31 t/s | 13.13 t/s |

分析:模型超出核显显存,被内存带宽(约 50–65GB/s DDR5)卡住;该平台不支持原生 FP4(fp4:0),MXFP4 靠运行时转换仍因 MoE 激活量小而在提示处理上最快;生成阶段纯吃带宽,Q4KXL 的布局对 RADV 驱动预取更友好,流式输出最快。三次运行标准差极小,结果稳定。

建议:聊天/流式场景选 Q4KXL;RAG/长上下文选 MXFP4MoE,提示处理快约 60%。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →