GLM-5.2 本地推理测试: ubatch 对 MoE 性能影响巨大
fuzhongkai · reddit · 2026-08-22
在 3 张 RTX PRO 6000 Blackwell 上对 GLM-5.2-UD-IQ2XXS GGUF 进行推理测试发现,增大 ubatch size 对长提示词的性能提升显著(从 763 t/s 提升至 1145 t/s),但对短提示词帮助不大。作者推测这与 GLM-5.2 的 256 专家 / Top-8 MoE 架构有关,更大的批次能提高专家 GEMM 的利用率。此外,在没有 NVLink 的 PCIe 连接下,分层拆分比张量并行 (TP=3) 快得多。
「Infra」频道最新
- 如何让 llama.cpp 正确支持多 GPU 显存 — erazortt · 2026-08-22
- AMD 显卡建议升级至 ROCm 7.10 — Present-Guitar-3967 · 2026-08-22
- FreeToken 实测:4090级显卡跑35B模型达100 tok/s — ViRROOO · 2026-08-22
- Ox Alpha 每天送出 100T tokens:算力成本达百万美元级 — teortaxesTex · 2026-08-22
- 企业 OpenAI 账单失控,求荐统一 AI 网关方案 — HurryOrganic · 2026-08-22
- Agent 静默失败跑出 4.7 万账单,传统监控已失效 — alifgokce · 2026-08-22