TensorSharp 跑 DeepSeek V4 Flash 性能超 llama.cpp
fuzhongkai · reddit · 2026-08-01
开源推理引擎 TensorSharp 宣布支持 DeepSeek-V4-Flash-0731 模型,并在多卡环境下跑出了超越 llama.cpp 的性能。
在 4 张 Nvidia A40 GPU(CUDA 12.8)的测试中,使用 unsloth 的 Q8KXL 量化版本:
- Prefill 速度:TensorSharp CUDA 后端达 836 tok/s,优于 llama.cpp 的 558 tok/s。
- Decode 速度:在短序列和 16K 上下文下,TensorSharp 也略优于 llama.cpp。
该项目支持 CUDA、Vulkan、Metal、兼容 OpenAI API、连续批处理及多 GPU/多节点推理。
所属事件:TensorSharp多卡跑DeepSeek性能超越llama.cpp(2 条相关)→
「Infra」频道最新
- a16z:AI 基础设施需求有增无减,供应链瓶颈成产业制约 — a16z · 2026-08-01
- Together AI 深度解析:LLM 推理自动扩缩容避坑指南 — togethercompute · 2026-08-01
- Vercel AI Gateway 支持团队与项目级预算上限 — cramforce · 2026-08-01
- 特斯拉签下469兆瓦太阳能协议,提前数年锁定AI算力电力 — XFreeze · 2026-08-01
- DGX Spark 本地部署:Qwen 3.5 122B 后的模型升级选择探讨 — Voxandr · 2026-08-01
- 分析师路透:Equinix圣何塞园区扩建约200MW — BenBajarin · 2026-08-01