GLM-5.3 推理提速 21 倍,Kimi 线性解码优化内核实测

teortaxesTex · x · 2026-08-22

KernelBench-Mega 测试显示,GLM-5.3 在 RTX PRO 6000 上通过 Kimi-Linear Decode 优化,实现了比 PyTorch 基准快 21.4 倍的性能(此前 GLM-5.2 为 11.1 倍)。该优化仅需一次 CUDA loadinline 启动,使用持久化 512 线程 CTA 和 30 个栅栏,并将 Int4 反量化保留在 GEMV 内,通过吸收 MLA 避免了庞大 KV 的具象化。对比榜单显示,GLM-5.3 在该基准下表现优异,甚至超过了部分主流模型。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →