Radeon 680M 核显跑 GLM-4.7:三种量化格式实测对比
tabletuser_blogspot · reddit · 2026-08-19
在 Acemagic 迷你主机(Ryzen 7 6800H + Radeon 680M 核显,64GB DDR5,Ubuntu + llama.cpp Vulkan)上实测 GLM-4.7-Flash 的三种量化(GGUF 头显示实为 deepseek2 30B.A3B MoE 架构):MXFP4 MoE(15.79GiB)、UD-Q4KXL(16.31GiB)、Q4KM(17.05GiB)。
结果(3 次平均,Flash Attention 开启):
| 格式 | 提示处理 pp512 | 生成 tg128 |
|---|---|---|
| MXFP4 MoE | 258.36 t/s | 11.66 t/s |
| Q4KM | 218.22 t/s | 12.09 t/s |
| UD-Q4KXL | 160.31 t/s | 13.13 t/s |
分析:模型超出核显显存,被内存带宽(约 50–65GB/s DDR5)卡住;该平台不支持原生 FP4(fp4:0),MXFP4 靠运行时转换仍因 MoE 激活量小而在提示处理上最快;生成阶段纯吃带宽,Q4KXL 的布局对 RADV 驱动预取更友好,流式输出最快。三次运行标准差极小,结果稳定。
建议:聊天/流式场景选 Q4KXL;RAG/长上下文选 MXFP4MoE,提示处理快约 60%。
「Infra」频道最新
- Marvell 获 Google 认股证,合作开发 TPU 生态定制芯片 — firstadopter · 2026-08-19
- Marvell 与 Google 签定制芯片协议,接入 TPU 生态用于 AI 推理 — firstadopter · 2026-08-19
- SALT:基于 CELF 的 KV Cache 句子级压缩检索 — No_Sky9786 · 2026-08-19
- 超越人类直觉:AI 设计出 500 倍于工程师极限的微小芯片组件 — ChuckDBrooks · 2026-08-19
- ComfyUI 突发卡顿崩溃,MiniMax H3 节点报错求助 — Fit-Association-448 · 2026-08-19
- 建议 Anthropic 用 Tenstorrent 降低推理成本 — DavidBennett__ · 2026-08-19