TensorSharp 在 8×A40 上把 DeepSeek V4.1 Flash 解码优化到 41 tok/s
fuzhongkai · reddit · 2026-09-12
TensorSharp 开源 LLM 推理引擎的开发者分享了在 8× NVIDIA A40(层切分)上运行 DeepSeek V4.1 Flash 的优化结果:
| 指标 | 优化后 |
|---|---|
| Q2K 单请求解码 | 41.1 tok/s |
| Q2K prefill(GPU 常驻 Engram 测试) | 532–541 tok/s |
| Q2K 冷启动加载(MooseFS 存储) | 144–155 秒(约快 2.5 倍) |
关键改动:
- 减少同步:把 CUDA 与自定义算子按每 GPU 包成一个后端,解码图分区从 565–577 降到 8,解码从 35.6 提升到 41.1 tok/s(约 15%)。
- GPU 常驻 Engram:量化查找表留在 GPU 上,避免 CPU 行查找,省掉约 130 秒的主机表预热。
- 顺序加载优于多线程:给每个读取器分配连续文件区间,恢复网络存储上的有效预读,是加载提速 2.5 倍的主因。
作者声明这些是项目自测基准,并非宣称优于 llama.cpp,因为缺少同权重参考对比,并欢迎独立复测。
「Infra」频道最新
- 网友盘点 2026 年真能跑 AI 的边缘设备:Mac 到 iPhone 17 Pro — MaziyarPanahi · 2026-09-12
- 双 3090 跑 Qwen3.8 Flash Next:llama.cpp 配置求调优,附完整参数 — ChopSticksPlease · 2026-09-12
- 遭伊朗袭击后,阿联酋 5GW AI 园区改设计为抗打击分布式布局 — mark_k · 2026-09-12
- 单张 RTX 5090 跑 502GB 模型:DeepSeek V4.1-Flash 展示本地 AI 新架构 — AccBalanced · 2026-09-12
- 团队日跑100-200个Agent后发现:瓶颈已从算力变成磁盘空间 — vincent_koc · 2026-09-12
- Orca 发布 DeepSeek V4.1 Flash 去审查 MLX 权重,面向安全研究 — AccBalanced · 2026-09-12