双 CMP 170HX 共 128GB 跑 GLM-5.3-Flash:384K 上下文约 90 tok/s
Prudent_Appearance71 · reddit · 2026-10-08
一位 r/LocalLLaMA 用户分享了在两张 64GB CMP 170HX(SM80 架构、PCIe Gen2)上本地运行 GLM-5.3-Flash(320B 总参数/约 18B 激活的 MoE)的稳定配置:
- 配置要点:EXL3 3.05bpw 量化,约 125GB 权重全量驻留 HBM(HBM-first/全驻留方案,不做专家流式换入换出),配 DFlash2 投机解码、Q8 KV cache,实际可用 384K 上下文(约 393K 请求预算),实测约 90 tok/s。
- 量化质量:EXL3 采用 trellis 混合精度,专家张量压得狠、敏感路径留高精度(lmhead 6-bit 等)。据公开 3.0bpw 置信度测试(51,175 个 held-out token 位置),Top-1 一致率约 93%、Mean KLD 约 0.050,优于 UD-IQ4XS(88.18%),接近 UD-Q4KXL 的水平,而体积只有约 125GB。
- 对比:同一台机器上与 Qwen3.8-Flash-Next(AWQ INT4 + FP8,vLLM)做了 PP/TG 与少量编码/agent 任务对比,作者强调引擎与投机解码设置不同,非严格对等比较。
GitHub 仓库与可玩 demo 已放出:glm53-flash-cmp170hx-exl3。
「Infra」频道最新
- Scaling laws 到极限了吗?Reddit 求解当前 AI 扩展现状 — StupidDialUp · 2026-10-08
- TRIAGE 方法修复 NVFP4 量化 RL 训练不稳,吞吐达 BF16 的 2.3 倍 — InfiX-ai · 2026-10-08
- WSL 容器功能正式 GA:一条命令在 Windows 上跑 Linux 容器 — pavandavuluri · 2026-10-08
- ai& 自称日本最大推理服务商,披露数据中心与后训练布局 — DavidBennett__ · 2026-10-08
- 微软发布 Surface Laptop Ultra:首搭 RTX Spark,2599 美元起 — Ars Technica AI · 2026-10-08
- DeepSeek V4.1 缓存压缩至 1/437,Flash 以 39 分反超 V4-Pro — DeepLearningAI · 2026-10-08