单机 8x 5090 实现 167k tokens/s 训练吞吐,超越 DDP 基线
jon_durbin · x · 2026-07-30
作者展示了在单台搭载 8 张 5090 显卡的机器上,使用 Parallax 框架进行测试时实现了高达 167k tokens/s 的训练吞吐量(基于 50亿参数总/10亿激活参数的 MoE 测试模型)。
关键性能与优化指标:
- 高 MFU:在 BF16 精度下,算力利用率(MFU)等效达到约 60%。
- 更优的损失曲线:在匹配相同步数的情况下,击败了 DDP(分布式数据并行)基线。
- 高效收敛:在处理约 190 亿 tokens(Llama-3 分词器)时达到 3.068 nats,相比 DDP 基线,达到相同 token 预算时速度快 15%,成本低 64%。
作者推测这种性能优势主要归功于为专家网络使用了独立的 Muon 优化器,结合了替代反馈与折叠归一化等技术。目前正准备进行更大规模的训练运行。
所属事件:单机8x5090实现167k tokens/s训练吞吐(2 条相关)→
「Infra」频道最新
- AI 算力竞赛背后的隐忧:全球电力产能扩张现状盘点 — lemire · 2026-07-30
- 马斯克再曝 xAI 算力版图:Minihard 与 Macroharder 齐聚 22 万张 GB300 — kevinnbass · 2026-07-30
- 单日回撤 6 亿美元:Leopold 的 AI 算力基建投资盘点 — ivan_bezdomny · 2026-07-30
- YC Paper Club 深度解析:多 GPU 内核优化与本地推理的能效比 — Y Combinator · 2026-07-30
- SK海力士财报分析:AI内存需求强劲,市场过虑产能过剩 — tengyanAI · 2026-07-30
- Buildcleaner 开源工具可清理 443GB 构建缓存,免费 MIT 许可 — jasonkneen · 2026-07-30