DeepSeek-V4 在昇腾 SuperPOD 上后训练达 34.22% MFU
_akhaliq · x · 2026-07-23
SLAI T-Rex:DeepSeek-V4 家族在昇腾 SuperPOD 上的全参数后训练
这篇论文讲的是:如何在华为 Ascend SuperPOD 上,对 trillion 级参数的 MoE 模型做端到端后训练优化,重点解决大模型训练里最常见的系统瓶颈。
- 论文以 DeepSeek-V4 家族 为目标,系统性处理了 显存压力、通信开销、内核执行效率低 等问题。
- 作者搭建了一个分层优化框架,覆盖 模型并行、计算/通信编排、底层 kernel 执行。
- 在报告的系统上,优化后训练吞吐达到 34.22% MFU,相比开源 baseline 提升 2.93×,同时保持了训练稳定性。
- 基于这套基础设施,作者进一步建立了面向复杂推理/运筹优化任务的 CPT 和 SFT 数据与训练管线。
- 他们把这个整合框架称为 SLAI T-Rex,并用 DeepSeek-V4-Flash 构建了面向 OR 任务的数据管线,结合了收集来的领域资源和经过求解器验证的合成优化文档。
- 数据集包含 1 万 条高质量 SFT 样本,覆盖 4 类任务 和 3 种问题表示。
- 在评测中,模型拿到评测集上的最佳平均 zero-shot Pass@1,达到 71.81%,分别比 GPT-5.4-Mini 和基础版 DeepSeek-V4-Flash 高 3.98 和 11.27 个百分点。
所属事件:昇腾 SuperPOD 全栈优化实现 DeepSeek-V4 高效训练(3 条相关)→
「Infra」频道最新
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11