DeepSeek-V4-Pro 在 Ascend 910C 训练中暴露长尾算子瓶颈
teortaxesTex · x · 2026-07-23
这条帖子指向一篇关于 DeepSeek-V4-Pro 在华为 Ascend 910C 上训练 的内容,并顺带吐槽:还是没有说明 950 的情况。配图是训练剖析表,列出了在 Ascend 上训练时最主要的算子瓶颈和利用率数据。
图里能读出的重点
- 头部瓶颈包括 SparseAttnSharedkvGrad、MatMulV3、GroupedMatmul(MoE experts)。
- 文中强调存在一条很长的 碎片化、内存受限 kernel 长尾。
- 单个小 kernel 很短,但合起来会占掉相当可观的总计算时间。
这意味着什么
- 这是对 Ascend NPU 训练效率瓶颈的具体剖析,不只是泛泛而谈。
- 它说明除了大矩阵乘之外,很多小型内存受限算子同样会拖累整体利用率。
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11