TensorSharp MoE卸载实测:大模型显存占用暴降,速度远超llama.cpp
fuzhongkai · reddit · 2026-08-05
TensorSharp 框架新增了 MoE CPU-offload 功能,允许将混合专家(MoE)模型的专家层权重卸载至系统内存,从而在 12-16GB 显存的消费级显卡上也能运行 35B 等大参数模型。
作者在双 RTX PRO 6000 环境下,将其与 llama.cpp 进行了详细基准测试对比。结果显示,在开启 CPU 卸载时,TensorSharp 的性能表现远超 llama.cpp:
- Qwen 3.5 35B:在卸载 48 层时,TensorSharp 的 prompt 处理速度最高达到 llama.cpp 的 8.85 倍,生成速度达 3.31 倍。
- Gemma 4 26B:全量卸载时,prompt 处理速度最高快 5.59 倍,生成速度快 2.93 倍。
- GPT-OSS 20B:卸载 12 层时,prompt 处理速度可达 5.50 倍,生成速度为 2.83 倍。
作为代价,TensorSharp 在开启卸载后会比 llama.cpp 占用更多显存,但在可接受范围内。在完全不开启卸载的基线测试中,两者速度互有胜负。
「编程与Agent」频道最新
- 新书章节详解:多智能体系统中的记忆机制构建 — _nerdai_ · 2026-08-05
- Grok Build 实战:用 Overnight 模式保持主 Agent 上下文整洁 — yunta_tsai · 2026-08-05
- OpenRouter 推出 Ori Harness,一键配置多种 AI 编码工具 — mitsuhiko · 2026-08-05
- Steve Yegge 长文:用 Agent 群彻夜编程,CI/CD 将变「持续竞技场」 — rseroter · 2026-08-05
- Cloudflare 开源其 Agent 操作系统:含工作区与安全框架 — michellechen · 2026-08-05
- AI 一小时写完数周级 PHP 渗透链,安全专家担忧技能断层 — jedisct1 · 2026-08-05