TensorSharp 解码吞吐达 llama.cpp 两倍,GLM-5.3-Flash 实测

fuzhongkai · reddit · 2026-08-29

作者在 GLM-5.3-Flash(unsloth GGUF UD-Q2KXL,101GiB,双 GPU)上对比 TensorSharp 与 llama.cpp(PR #27754,CUDA 12.8):

解码翻倍的原因:TensorSharp 用形状为键的 LRU graph cache 复用已 CUDA 捕获的计算图,避免逐 token 重建;GLM 的 34 层 KDA 加超连接使逐 token 图又深又碎,恰好是重建开销最痛的场景。Prefill 是 GEMM bound,无此优化空间,因此两边接近。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →