昇腾SuperPOD全栈优化将DeepSeek-V4训练MFU提至34.22%
针对在昇腾Ascend NPU SuperPOD上训练DeepSeek-V4家族的万亿参数模型,一项名为SLAI T-Rex的全栈优化方案成功将模型训练效率(MFU)提升至34.22%。该系统实践重点解决了大规模集群下的全参数后训练难题,通过软硬件协同优化,显著提升了万亿参数模型的训练效率。
2026-07-23 ~ 2026-07-23 · 2 条相关
- 昇腾 SuperPOD 上 DeepSeek-V4 后训练达 34.22% MFU — Dongfang Li · 2026-07-23
- 昇腾 SuperPOD 优化把 DeepSeek-V4 训练 MFU 提到 34.22% — pmttyji · 2026-07-23