TensorSharp 实测:DeepSeek V4 Flash 多卡推理性能超 llama.cpp

fuzhongkai · reddit · 2026-08-01

开源推理引擎 TensorSharp 近期更新了多 GPU 与多节点推理支持,作者借此测试了其运行 DeepSeek-V4-Flash-0731 量化模型的性能,并与 llama.cpp 进行了对比。

测试环境与模型:

基准测试结果(TensorSharp CUDA 后端 vs llama.cpp):

在长文本的预填充阶段,TensorSharp 展现出明显的速度优势,但在解码生成阶段略逊于 llama.cpp。

所属事件:TensorSharp多卡跑DeepSeek性能超越llama.cpp(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →