英伟达 GB300 创纪录:预训练 DeepSeek-V3 达 1648 TFLOPs
PyTorch · x · 2026-08-07
PyTorch 官方与英伟达联合宣布,基于 PyTorch 原生训练栈 TorchTitan 和英伟达的软硬件优化,在 NVIDIA GB300 NVL72 系统上预训练 DeepSeek-V3 671B 模型创下了一项世界纪录。
- 性能突破:实现了单 GPU 高达 1,648 TFLOPs 的吞吐量,相比以往实现了约 6 倍的性能提升。
- 架构支撑:该成绩得益于第五代 NVLink 和跨节点网络提供的超高带宽,有效解决了 MoE(混合专家)架构在大规模扩展时的通信瓶颈。
- 扩展效率:在从 256 张 GPU 扩展到 1024 张 GPU 时,单 GPU 吞吐量保持在 97% 以上,证明了英伟达软硬件协同设计在提升大规模预训练效率上的显著成效。
「Infra」频道最新
- MiniMax 模型 2 倍加速真相:系新版 Python 库引入 convrot 支持 — lmpdev · 2026-08-07
- 马斯克:Terafab AI工厂一期将创造超3000个岗位 — elonmusk · 2026-08-07
- 传 Meta 自建搜索引擎,大规模爬取全网以摆脱对谷歌依赖 — churchkey · 2026-08-07
- SanDisk财报亮眼却跌价,AI推理推高存储需求 — ryanshrout · 2026-08-07
- Databricks CEO:五年后 AI 智能体流量将是人类的千倍 — threepointone · 2026-08-07
- 仅 8GB 内存跑 2.78 万亿参数模型,纯 C99 引擎开源 — dr_cintas · 2026-08-07