TensorSharp 解码吞吐达 llama.cpp 两倍,GLM-5.3-Flash 实测
fuzhongkai · reddit · 2026-08-29
作者在 GLM-5.3-Flash(unsloth GGUF UD-Q2KXL,101GiB,双 GPU)上对比 TensorSharp 与 llama.cpp(PR #27754,CUDA 12.8):
- Prefill 两者几乎持平:pp2048 约 2070 t/s vs 2014 t/s,pp32768 为 1483 vs 1446。
- Decode 快一倍:tg64 达 73.5 t/s vs 36.6 t/s(2.01×);长上下文下依然坚挺,17.7K prompt 后 40.9 t/s,36K 后 28.2 t/s。
- 权重 17 秒从热缓存加载,CPU-MoE 卸载(前 10 层专家驻留内存)可解码 35–40 t/s。
解码翻倍的原因:TensorSharp 用形状为键的 LRU graph cache 复用已 CUDA 捕获的计算图,避免逐 token 重建;GLM 的 34 层 KDA 加超连接使逐 token 图又深又碎,恰好是重建开销最痛的场景。Prefill 是 GEMM bound,无此优化空间,因此两边接近。
「Infra」频道最新
- Google Cloud 推出故障注入测试,自动验证云服务韧性 — rseroter · 2026-08-29
- 观点:本地模型将催生一类随行智能软件 — carsonfarmer · 2026-08-29
- 把系统插件设计成组织架构图?AI Event Steward 架构反思 — zakelfassi · 2026-08-29
- 传 OpenAI 芯片性能超越英伟达 Blackwell — dylan522p · 2026-08-29
- Cerebras CEO 解析架构:推理速度为何比 GPU 快 2500 倍 — rohanpaul_ai · 2026-08-29
- 形式化验证虽助 AI 安全,或加速硬件军备竞赛 — geoffreyirving · 2026-08-29