昇腾 SuperPOD 上 DeepSeek-V4 后训练达 34.22% MFU
Dongfang Li · hf · 2026-07-23
这篇工作做了什么
这是一套在 昇腾 Ascend NPU SuperPOD 上对 DeepSeek-V4 家族进行全参数后训练的系统实践,重点解决万亿参数 MoE 模型后训练中的显存压力、通信开销和 kernel 效率问题。
- 论文提出了一个分层优化框架,覆盖 模型并行、计算-通信编排、底层 kernel 执行。
- 训练系统最终达到 34.22% MFU,相较开源 baseline 提升 2.93 倍,同时保持训练稳定。
- 在此基础上,作者还为复杂 运筹学(OR) 任务搭建了 CPT + SFT 流程,使用 solver 约束的合成数据。
- 相关专门模型在零样本评测中达到 71.81% Pass@1,比 GPT-5.4-Mini 高 3.98 个百分点,比基础版 DeepSeek-V4-Flash 高 11.27 个百分点。
「Infra」频道最新
- Google 资本开支争议的关键,不只是云业务回报 — aronchick · 2026-07-23
- OpenAI 澳大利亚数据中心放弃再生水冷却,悉尼电网逼近上限 — Polymarket · 2026-07-23
- 多数任务用便宜模型就够,智能路由比全上 Opus 更合理 — bindureddy · 2026-07-23
- 4 张 RTX 3080 跑 Qwen3.6-27B,约 2000 美元可达 69 tok/s — starkruzr · 2026-07-23
- 面向 agent 的免费市场数据 API,带 llms.txt 和 OpenAPI — CaseLivid4116 · 2026-07-23
- 东方算芯 DF1000 被称 14nm 也能接近 Hopper 实用性 — teortaxesTex · 2026-07-23