DeepSeek-V4-Pro 在 Ascend 910C 训练中暴露长尾算子瓶颈
teortaxesTex · x · 2026-07-23
这条帖子指向一篇关于 DeepSeek-V4-Pro 在华为 Ascend 910C 上训练 的内容,并顺带吐槽:还是没有说明 950 的情况。配图是训练剖析表,列出了在 Ascend 上训练时最主要的算子瓶颈和利用率数据。
图里能读出的重点
- 头部瓶颈包括 SparseAttnSharedkvGrad、MatMulV3、GroupedMatmul(MoE experts)。
- 文中强调存在一条很长的 碎片化、内存受限 kernel 长尾。
- 单个小 kernel 很短,但合起来会占掉相当可观的总计算时间。
这意味着什么
- 这是对 Ascend NPU 训练效率瓶颈的具体剖析,不只是泛泛而谈。
- 它说明除了大矩阵乘之外,很多小型内存受限算子同样会拖累整体利用率。
「Infra」频道最新
- Google 资本开支两年内或将翻三倍 — SumitGup · 2026-07-23
- Hermes Cloud 支持按需扩容磁盘、CPU 和内存 — Teknium · 2026-07-23
- Google 采购的大量 GPU 还躺在仓库里等数据中心 — SumitGup · 2026-07-23
- Databricks 与 Microsoft 将 AI 合作延长到 2030 年代 — jefrankle · 2026-07-23
- CoreWeave 财报被指现金口径差出 3.4 亿美元 — BenBajarin · 2026-07-23
- llama.cpp 争论 `--cpu-moe` 是否比默认显存卸载更快 — kwizzle · 2026-07-23