TensorSharp MoE 卸载实测:速度最高达 llama.cpp 八倍

fuzhongkai · reddit · 2026-08-06

TensorSharp 的 MoE CPU-offload 特能已合并入主分支,允许将路由专家权重保留在系统内存中由 CPU 处理,从而在 12-16GB 显卡上运行 35B-A3B MoE 模型并保留长上下文 KV 缓存。

作者在双 RTX PRO 6000 Blackwell 环境下,对比了 TensorSharp 与 llama.cpp 在不同卸载深度下的性能表现:

虽然 TensorSharp 显存占用略高,但其在 MoE CPU 卸载场景下的推理速度取得了压倒性优势。

所属事件:TensorSharp MoE 卸载实测:显存暴降且速度远超 llama.cpp(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →