TensorSharp 实测 DeepSeek V4.1 Flash,八卡A40性能亮眼
开源推理引擎 TensorSharp 作者公布 DeepSeek V4.1 Flash GGUF 在 8×A40(layer split、F16 KV cache、65K 上下文)配置下的实测:解码速度约 40 tok/s。该引擎新增了 DeepSeek V4.1 Flash 专用执行路径,在 Q2K 量化下预填充可达 533–539 tok/s,突破 500 tok/s,显示消费级多卡部署新模型的可行性。
2026-09-13 ~ 2026-09-13 · 2 条相关
- 第 1 集:DeepSeek V4.1 Flash 上线 Together AI,性能超 GPT-5.6 Sol 成本仅三分之一(2026-09-12,3 条)
- 第 2 集:TensorSharp 实测 DeepSeek V4.1 Flash,八卡A40性能亮眼(2026-09-13,2 条)
- 第 3 集:DeepSeek V4.1-Flash 将 KV 缓存压至每 token 890 字节(2026-09-13,2 条)
- DeepSeek V4.1 Flash 八卡 A40 实测:自研推理引擎跑到 40 tok/s — fuzhongkai · 2026-09-13
- TensorSharp 引擎实测:DeepSeek V4.1 Flash 在 8×A40 上预填充破 500 tok/s — fuzhongkai · 2026-09-13