TensorSharp MoE卸载实测:大模型显存占用暴降,速度远超llama.cpp

fuzhongkai · reddit · 2026-08-05

TensorSharp 框架新增了 MoE CPU-offload 功能,允许将混合专家(MoE)模型的专家层权重卸载至系统内存,从而在 12-16GB 显存的消费级显卡上也能运行 35B 等大参数模型。

作者在双 RTX PRO 6000 环境下,将其与 llama.cpp 进行了详细基准测试对比。结果显示,在开启 CPU 卸载时,TensorSharp 的性能表现远超 llama.cpp:

作为代价,TensorSharp 在开启卸载后会比 llama.cpp 占用更多显存,但在可接受范围内。在完全不开启卸载的基线测试中,两者速度互有胜负。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →