TensorSharp MoE 卸载实测:速度最高达 llama.cpp 八倍
fuzhongkai · reddit · 2026-08-06
TensorSharp 的 MoE CPU-offload 特能已合并入主分支,允许将路由专家权重保留在系统内存中由 CPU 处理,从而在 12-16GB 显卡上运行 35B-A3B MoE 模型并保留长上下文 KV 缓存。
作者在双 RTX PRO 6000 Blackwell 环境下,对比了 TensorSharp 与 llama.cpp 在不同卸载深度下的性能表现:
- Gemma 4 26B:全层卸载时,TensorSharp 的 Prompt 处理速度(pp)和生成速度(tg)均显著领先,最高达 5.59 倍与 3.07 倍。
- Qwen 3.5 35B:速度优势更为明显,全层卸载时 pp 速度最高快 8.85 倍,tg 速度最高快 4.50 倍。
- GPT-OSS 20B:TensorSharp 在卸载场景下同样保持 5-7 倍的 pp 速度优势与近 3 倍的 tg 速度优势。
虽然 TensorSharp 显存占用略高,但其在 MoE CPU 卸载场景下的推理速度取得了压倒性优势。
所属事件:TensorSharp MoE 卸载实测:显存暴降且速度远超 llama.cpp(2 条相关)→
「Infra」频道最新
- 实测智能 LLM 路由:成本直降 65%,准确率保持 99.2% — shensi · 2026-08-06
- Cloudflare 发布开源 Cloudflare OS,定位 AI 操作系统 — Fcking_Chuck · 2026-08-06
- Cloudflare 发布开源操作系统,打造 AI 专属底层设施 — Fcking_Chuck · 2026-08-06
- YC 新创 Standard Machines 发力 AI 芯片设计,用强化学习加速流片 — ycombinator · 2026-08-06
- Proxmox VE 正式支持 ARM64,可混搭 x86 架构集群 — unixterminal · 2026-08-06
- Google TPU 算力优势与 AlphaChip 现状引开发者群嘲 — teortaxesTex · 2026-08-06