DeepSeek V4.1 Flash 八卡 A40 实测:自研推理引擎跑到 40 tok/s
fuzhongkai · reddit · 2026-09-13
开源推理引擎 TensorSharp 作者公布 DeepSeek V4.1 Flash GGUF 在 8×A40(layer split、F16 KV cache、65K 上下文)上的成绩:
- Q2K:prefill 约 533–539 tok/s,单请求 decode 40.3–40.7 tok/s
- Q4KM:prefill 452–492 tok/s,单请求 decode 31–32.5 tok/s;4 并发总吞吐 48.9 tok/s
关键优化:Q2K 将约 60 GiB 量化 Engram 表常驻 GPU,并把每 GPU 后端统一,使 decode 图切分从约 570 降到 8;Q4KM 的更大表留在主机内存,靠自动预热、显存预算收紧和 token 批量 decode 拿到约 1.9× prefill 与 2× 四并发吞吐,40 层中仅 1 层专家留在 CPU。
另一反直觉发现:在这台无 NVLink 的机器上,layer split(31–32.5 tok/s)反而胜过实验性 MoE 张量并行(21.4–22 tok/s)。作者也诚实注明这是项目自报数据,数值/生成质量一致性未验证,批处理可能改变输出。
「Infra」频道最新
- 求助:Beellama 旧缓存降量化方案,对编码质量影响有多大? — RadianceTower · 2026-09-13
- CME 下月推 H100/B200 现金结算 GPU 期货,但谁来买对冲存疑 — AccBalanced · 2026-09-13
- 模块化数据中心并未消灭人力瓶颈,只是把工人短缺搬进了工厂 — AccBalanced · 2026-09-13
- 把 AI agent 直接连生产服务器:DigitalOcean 工作流替代 Vercel — Daniel_Farinax · 2026-09-13
- CPU 短缺悄然蔓延:中型以上公司云上已难预订所需 CPU — Sethwinterroth · 2026-09-13
- 三星首座 2nm 工厂未投产已被特斯拉、Arm、博通预订一空 — Beth_Kindig · 2026-09-13