DeepSeek V4.1-Flash 昇腾 950DT 部署单卡解码达 5800 TPS,遭质疑实际吞吐偏低
teortaxesTex · x · 2026-10-04
- 开发者 Leroy Li 称,在 32 张华为昇腾 950DT 上用 FP8-FP4 混合精度部署 DeepSeek-V4.1-Flash:128K 长序列场景单卡解码吞吐达 5800 TPS(时延 13.79 ms);低时延场景时延控制在 5 ms 内、吞吐 2727 TPS。
- 网友 teortaxesTex 质疑该成绩并不亮眼:即便达到 72 TPS 这类数字,整体吞吐也仅为 DSpark 报告中 DeepSeek V4-Flash 单 GPU 成绩的三分之一,尽管已使用 TileLang 内核。他认为可能需要更大的部署单元,或等后续优化(如 npugraphex)才能改善。
「Infra」频道最新
- NYT:中国 AI 推广过头,用量过大反成新问题 — TMWNN · 2026-10-04
- UBS 算力供应链交期表:晶圆厂 3-4 年,GPU 仅 6-12 个月 — AccBalanced · 2026-10-04
- NVIDIA NIM API 速度尚可但稳定性差,用户求替代方案 — Professional_Log1367 · 2026-10-04
- 开源 LLMxRay:一行命令给本地 LLM 装上实时可观测性 — GuruCsharp · 2026-10-04
- Will Chamberlain:若 AGI 同期到来,数据中心建设的激进程度本会收敛 — willcb · 2026-10-04
- UBS 预测 2030 年全球机架部署将达 104.5 GW,Nvidia 占 50.5 GW — AccBalanced · 2026-10-04