单机8x5090实现167k tokens/s训练吞吐
开发者使用 Parallax 框架在搭载 8 张 5090 显卡的单机上测试,实现了高达 167k tokens/s 的训练吞吐量,超越了 DDP 基线。然而,这种算法层面的优化加速也带来了“幸福的烦恼”,随着性能提升,节点间的通信带宽需求持续增加,进而可能引发通信带宽瓶颈。
2026-07-30 ~ 2026-07-30 · 2 条相关
- 单机 8x 5090 实现 167k tokens/s 训练吞吐,超越 DDP 基线 — jon_durbin · 2026-07-30
- 分布式训练优化:加速算法导致通信带宽瓶颈 — jon_durbin · 2026-07-30