单机 8x 5090 实现 167k tokens/s 训练吞吐,超越 DDP 基线

jon_durbin · x · 2026-07-30

作者展示了在单台搭载 8 张 5090 显卡的机器上,使用 Parallax 框架进行测试时实现了高达 167k tokens/s 的训练吞吐量(基于 50亿参数总/10亿激活参数的 MoE 测试模型)。

关键性能与优化指标:

作者推测这种性能优势主要归功于为专家网络使用了独立的 Muon 优化器,结合了替代反馈与折叠归一化等技术。目前正准备进行更大规模的训练运行。

所属事件:单机8x5090实现167k tokens/s训练吞吐(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →