TensorSharp 在 8×A40 上把 DeepSeek V4.1 Flash 解码优化到 41 tok/s

fuzhongkai · reddit · 2026-09-12

TensorSharp 开源 LLM 推理引擎的开发者分享了在 8× NVIDIA A40(层切分)上运行 DeepSeek V4.1 Flash 的优化结果:

| 指标 | 优化后 |

|---|---|

| Q2K 单请求解码 | 41.1 tok/s |

| Q2K prefill(GPU 常驻 Engram 测试) | 532–541 tok/s |

| Q2K 冷启动加载(MooseFS 存储) | 144–155 秒(约快 2.5 倍) |

关键改动:

作者声明这些是项目自测基准,并非宣称优于 llama.cpp,因为缺少同权重参考对比,并欢迎独立复测。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →