TensorSharp MoE 卸载实测:显存暴降且速度远超 llama.cpp
TensorSharp 框架新增的 MoE CPU-offload 功能已合并入主分支。该特性允许将混合专家模型的路由专家权重保留在系统内存中由 CPU 处理,从而在 12-16GB 显存的消费级显卡上也能运行 35B-A3B 等大模型。实测数据显示,该方案不仅大幅降低了显存占用,其运行速度最高更是达到了 llama.cpp 的八倍。
2026-08-05 ~ 2026-08-06 · 2 条相关
- TensorSharp MoE卸载实测:大模型显存占用暴降,速度远超llama.cpp — fuzhongkai · 2026-08-05
另有 1 条近重复转述:fuzhongkai