昇腾 SuperPOD 优化把 DeepSeek-V4 训练 MFU 提到 34.22%
pmttyji · reddit · 2026-07-23
昇腾 SuperPOD 上把 DeepSeek-V4 训练效率提到 34.22%
这篇论文介绍了一个名为 SLAI T-Rex 的全栈优化方案,目标是在 Ascend NPU SuperPOD 上对 DeepSeek-V4 系列做全参数后训练,解决万亿参数 MoE 模型常见的显存压力、通信开销和 kernel 低效问题。
- 方案覆盖模型并行、计算/通信编排和底层 kernel 优化。
- 论文称最终达到 34.22% MFU,相比开源基线 recipe 提升 2.93 倍,同时保持训练稳定。
- 基于这套基础设施,作者还做了面向运筹优化任务的 CPT / SFT 流程,使用 DeepSeek-V4-Flash 构建数据管线。
- 数据集包含 1 万条高质量 SFT 样本,覆盖 4 类任务和 3 种问题表示。
- 在评测中,专用模型的平均 zero-shot Pass@1 达到 71.81%,分别比 GPT-5.4-Mini 和基础版 DeepSeek-V4-Flash 高 3.98 和 11.27 个百分点。
整体上,这是一条从昇腾基础设施优化到领域专用 Flash 模型训练的完整路径。
所属事件:昇腾SuperPOD全栈优化将DeepSeek-V4训练MFU提至34.22%(2 条相关)→
「Infra」频道最新
- 多智能体系统真正难点在编排,不在推理 — njanChe1 · 2026-07-23
- 算上口型同步,AI 视频配音每成片分钟约 5 到 7 美元 — Madmahi25 · 2026-07-23
- Nebius 在芬兰展示首个 NVIDIA Vera Rubin NVL72 机架 — demian_ai · 2026-07-23
- Bittensor 一个子网把推理价格压到差不多一半 — markjeffrey · 2026-07-23
- turbopuffer 调整扩缩容信号后把排队时间缩短一半 — DanielLockyer · 2026-07-23
- 做 1 吉瓦数据中心,电网要先补 2 吉瓦 — anderssandberg · 2026-07-23