TensorSharp 实测:DeepSeek V4 Flash 多卡推理性能超 llama.cpp
fuzhongkai · reddit · 2026-08-01
开源推理引擎 TensorSharp 近期更新了多 GPU 与多节点推理支持,作者借此测试了其运行 DeepSeek-V4-Flash-0731 量化模型的性能,并与 llama.cpp 进行了对比。
测试环境与模型:
- 硬件:4 张 Nvidia A40 GPU (CUDA 12.8)
- 模型:DeepSeek-V4-Flash-0731-UD-Q8KXL (来自 unsloth)
基准测试结果(TensorSharp CUDA 后端 vs llama.cpp):
- Prefill (16K):836 tok/s(TensorSharp 最优),llama.cpp 为 558 tok/s
- Decode (短文本):31.5 tok/s,llama.cpp 为 35.3 tok/s
- Decode (16K):28.5 tok/s,llama.cpp 为 32.2 tok/s
在长文本的预填充阶段,TensorSharp 展现出明显的速度优势,但在解码生成阶段略逊于 llama.cpp。
所属事件:TensorSharp多卡跑DeepSeek性能超越llama.cpp(2 条相关)→
「Infra」频道最新
- a16z:AI 基础设施需求有增无减,供应链瓶颈成产业制约 — a16z · 2026-08-01
- Together AI 深度解析:LLM 推理自动扩缩容避坑指南 — togethercompute · 2026-08-01
- Vercel AI Gateway 支持团队与项目级预算上限 — cramforce · 2026-08-01
- 特斯拉签下469兆瓦太阳能协议,提前数年锁定AI算力电力 — XFreeze · 2026-08-01
- DGX Spark 本地部署:Qwen 3.5 122B 后的模型升级选择探讨 — Voxandr · 2026-08-01
- 分析师路透:Equinix圣何塞园区扩建约200MW — BenBajarin · 2026-08-01