PufferLib 5.0 发布:单 GPU 跑出 6000 万步/秒强化学习训练

jsuarez · x · 2026-09-17

PufferLib 5.0 发布,作者 accompanying 深度工程文章:单 GPU 有效训练吞吐最高约 6000 万步/秒,可在 1 秒内解出 Breakout。4.0 版本靠 8 个月自研 CUDA C 栈突破瓶颈,5.0 在此基础上打磨优化。

关键性能数据:吞吐量在参数量低至 10 万以下仍保持线性扩展——10 万参数时端到端峰值约 5000 万步/秒,100 万参数约 1000 万步/秒,1000 万参数约 180 万步/秒。作者称这种向下扩展的线性度在业内极为罕见,与硅谷普遍关注的「放大训练」难点(更多 GPU 带来通信开销等)方向相反。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →