DeepSeek-V4 在昇腾 SuperPOD 上后训练达 34.22% MFU
_akhaliq · x · 2026-07-23
SLAI T-Rex:DeepSeek-V4 家族在昇腾 SuperPOD 上的全参数后训练
这篇论文讲的是:如何在华为 Ascend SuperPOD 上,对 trillion 级参数的 MoE 模型做端到端后训练优化,重点解决大模型训练里最常见的系统瓶颈。
- 论文以 DeepSeek-V4 家族 为目标,系统性处理了 显存压力、通信开销、内核执行效率低 等问题。
- 作者搭建了一个分层优化框架,覆盖 模型并行、计算/通信编排、底层 kernel 执行。
- 在报告的系统上,优化后训练吞吐达到 34.22% MFU,相比开源 baseline 提升 2.93×,同时保持了训练稳定性。
- 基于这套基础设施,作者进一步建立了面向复杂推理/运筹优化任务的 CPT 和 SFT 数据与训练管线。
- 他们把这个整合框架称为 SLAI T-Rex,并用 DeepSeek-V4-Flash 构建了面向 OR 任务的数据管线,结合了收集来的领域资源和经过求解器验证的合成优化文档。
- 数据集包含 1 万 条高质量 SFT 样本,覆盖 4 类任务 和 3 种问题表示。
- 在评测中,模型拿到评测集上的最佳平均 zero-shot Pass@1,达到 71.81%,分别比 GPT-5.4-Mini 和基础版 DeepSeek-V4-Flash 高 3.98 和 11.27 个百分点。
所属事件:昇腾 SuperPOD 全栈优化实现 DeepSeek-V4 高效训练(3 条相关)→
「Infra」频道最新
- Intel 和 AMD 据称正与中国客户锁定长期 CPU 订单 — pstAsiatech · 2026-07-23
- 谷歌千亿净利润背后:87% 源自 Anthropic 等 AI 股权投资浮盈 — JensHonack · 2026-07-23
- Google 把 AI 资本开支提到 2000 亿美元,股价仍被抛售 — JOBhakdi · 2026-07-23
- AI巨额资本支出引发市场恐慌,谷歌等科技巨头股价大跌 — JOBhakdi · 2026-07-23
- vLLM 表示 prime-rl 在 28 台 H200 上跑万亿级 agentic RL — vllm_project · 2026-07-23
- GLM-5.2 新增视觉支持并开源,附 SGLang 运行说明 — baseten · 2026-07-23