TensorSharp 引擎实测:DeepSeek V4.1 Flash 在 8×A40 上预填充破 500 tok/s
fuzhongkai · reddit · 2026-09-13
开源推理引擎 TensorSharp 新增 DeepSeek V4.1 Flash 专用执行路径,在 8× NVIDIA A40 上取得:Q2K 预填充 533–539 tok/s、单流解码约 40 tok/s;Q4KM 预填充 451–492 tok/s、解码约 31 tok/s、4 并发聚合 48.9 tok/s。配置为 8 卡层切分、F16 KV cache、65K 上下文。关键优化发现:
- Engram 查表是主要瓶颈:Q2K 的两张 Engram 表约 60 GiB,将量化行常驻 GPU 后预填充从 210 提到 535 tok/s
- 用「每 GPU 一个 wrapper backend」替代分离的 custom/CUDA 后端,把解码图调度切分从 570 降到 8,解码提到 40 tok/s
- Q4KM 的 Engram 表过大无法常驻,改用异步主机预热 + 更优 VRAM 布局,把主机 MoE offload 从 3 层降到 1 层
- 新的 token-batched decode 让 4 并发聚合吞吐近翻倍
- 有趣的反直觉结果:无 NVLink 且跨 NUMA 节点时,routed-expert TP=8 反而比层切分慢(22 vs 32 tok/s),通信开销盖过了权重布局收益
所属事件:TensorSharp 实测 DeepSeek V4.1 Flash,八卡A40性能亮眼(2 条相关)→
「Infra」频道最新
- 纯 SQLite 打造编码助手持久记忆:32MB 内存毫秒级查询 — Rude_Gate7599 · 2026-09-14
- $3000 搭 128GB 显存家用推理服务器:Qwen3.8-next 跑出 1300 tps prefill — Thin_Pollution8843 · 2026-09-14
- Q2 全球前十大晶圆厂营收 535 亿美元,台积电独占 72.5% 份额 — Beth_Kindig · 2026-09-14
- RTX 3090 24G 单卡跑 Qwen3.8 27B INT4,144K 上下文 71/75 评测 — Altruistic_Heat_9531 · 2026-09-14
- Nvidia 单季净利 597 亿美元,日均赚约 6.6 亿美元 — himanshustwts · 2026-09-14
- 极客用 Claude Code 造超小神经网络,M4 芯片跑出 1500 tok/s — GregoryDiamos · 2026-09-14