DeepSeek V4.1 Flash 八卡 A40 实测:自研推理引擎跑到 40 tok/s

fuzhongkai · reddit · 2026-09-13

开源推理引擎 TensorSharp 作者公布 DeepSeek V4.1 Flash GGUF 在 8×A40(layer split、F16 KV cache、65K 上下文)上的成绩:

关键优化:Q2K 将约 60 GiB 量化 Engram 表常驻 GPU,并把每 GPU 后端统一,使 decode 图切分从约 570 降到 8;Q4KM 的更大表留在主机内存,靠自动预热、显存预算收紧和 token 批量 decode 拿到约 1.9× prefill 与 2× 四并发吞吐,40 层中仅 1 层专家留在 CPU。

另一反直觉发现:在这台无 NVLink 的机器上,layer split(31–32.5 tok/s)反而胜过实验性 MoE 张量并行(21.4–22 tok/s)。作者也诚实注明这是项目自报数据,数值/生成质量一致性未验证,批处理可能改变输出。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →