昇腾 SuperPOD 优化把 DeepSeek-V4 训练 MFU 提到 34.22%
pmttyji · reddit · 2026-07-23
昇腾 SuperPOD 上把 DeepSeek-V4 训练效率提到 34.22%
这篇论文介绍了一个名为 SLAI T-Rex 的全栈优化方案,目标是在 Ascend NPU SuperPOD 上对 DeepSeek-V4 系列做全参数后训练,解决万亿参数 MoE 模型常见的显存压力、通信开销和 kernel 低效问题。
- 方案覆盖模型并行、计算/通信编排和底层 kernel 优化。
- 论文称最终达到 34.22% MFU,相比开源基线 recipe 提升 2.93 倍,同时保持训练稳定。
- 基于这套基础设施,作者还做了面向运筹优化任务的 CPT / SFT 流程,使用 DeepSeek-V4-Flash 构建数据管线。
- 数据集包含 1 万条高质量 SFT 样本,覆盖 4 类任务和 3 种问题表示。
- 在评测中,专用模型的平均 zero-shot Pass@1 达到 71.81%,分别比 GPT-5.4-Mini 和基础版 DeepSeek-V4-Flash 高 3.98 和 11.27 个百分点。
整体上,这是一条从昇腾基础设施优化到领域专用 Flash 模型训练的完整路径。
所属事件:昇腾 SuperPOD 全栈优化实现 DeepSeek-V4 高效训练(3 条相关)→
「Infra」频道最新
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11