TensorSharp 运行 GLM-5.2 性能反超 llama.cpp

AdhesivenessWeird770 · reddit · 2026-08-20

在 3 张 RTX PRO 6000 Blackwell 上对 GLM-5.2-UD-IQ2XXS 模型进行了测试。结果显示,在短提示词下 llama.cpp 略快,但在长上下文(2048+ tokens)处理中,TensorSharp 利用更大的微批次优化了 MoE 结构,速度显著领先(最高快 50%)。原因在于 GLM-5.2 的 256 路由专家结构在大批次下 GPU 利用率更高。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →