昇腾 SuperPOD 上 DeepSeek-V4 后训练达 34.22% MFU
Dongfang Li · hf · 2026-07-23
这篇工作做了什么
这是一套在 昇腾 Ascend NPU SuperPOD 上对 DeepSeek-V4 家族进行全参数后训练的系统实践,重点解决万亿参数 MoE 模型后训练中的显存压力、通信开销和 kernel 效率问题。
- 论文提出了一个分层优化框架,覆盖 模型并行、计算-通信编排、底层 kernel 执行。
- 训练系统最终达到 34.22% MFU,相较开源 baseline 提升 2.93 倍,同时保持训练稳定。
- 在此基础上,作者还为复杂 运筹学(OR) 任务搭建了 CPT + SFT 流程,使用 solver 约束的合成数据。
- 相关专门模型在零样本评测中达到 71.81% Pass@1,比 GPT-5.4-Mini 高 3.98 个百分点,比基础版 DeepSeek-V4-Flash 高 11.27 个百分点。
所属事件:昇腾 SuperPOD 全栈优化实现 DeepSeek-V4 高效训练(3 条相关)→
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11