GLM-5.2 本地推理测试: ubatch 对 MoE 性能影响巨大

fuzhongkai · reddit · 2026-08-22

在 3 张 RTX PRO 6000 Blackwell 上对 GLM-5.2-UD-IQ2XXS GGUF 进行推理测试发现,增大 ubatch size 对长提示词的性能提升显著(从 763 t/s 提升至 1145 t/s),但对短提示词帮助不大。作者推测这与 GLM-5.2 的 256 专家 / Top-8 MoE 架构有关,更大的批次能提高专家 GEMM 的利用率。此外,在没有 NVLink 的 PCIe 连接下,分层拆分比张量并行 (TP=3) 快得多。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →