TensorSharp 跑 DeepSeek V4 Flash 性能超 llama.cpp

fuzhongkai · reddit · 2026-08-01

开源推理引擎 TensorSharp 宣布支持 DeepSeek-V4-Flash-0731 模型,并在多卡环境下跑出了超越 llama.cpp 的性能。

在 4 张 Nvidia A40 GPU(CUDA 12.8)的测试中,使用 unsloth 的 Q8KXL 量化版本:

该项目支持 CUDA、Vulkan、Metal、兼容 OpenAI API、连续批处理及多 GPU/多节点推理。

所属事件:TensorSharp多卡跑DeepSeek性能超越llama.cpp(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →