PufferLib 5.0 发布:单 GPU 跑出 6000 万步/秒强化学习训练
jsuarez · x · 2026-09-17
PufferLib 5.0 发布,作者 accompanying 深度工程文章:单 GPU 有效训练吞吐最高约 6000 万步/秒,可在 1 秒内解出 Breakout。4.0 版本靠 8 个月自研 CUDA C 栈突破瓶颈,5.0 在此基础上打磨优化。
关键性能数据:吞吐量在参数量低至 10 万以下仍保持线性扩展——10 万参数时端到端峰值约 5000 万步/秒,100 万参数约 1000 万步/秒,1000 万参数约 180 万步/秒。作者称这种向下扩展的线性度在业内极为罕见,与硅谷普遍关注的「放大训练」难点(更多 GPU 带来通信开销等)方向相反。
「Infra」频道最新
- mlx.fast 修复计速 bug:MLX 实测 80.6 tps,接近翻倍目标 — HankYeomans · 2026-09-17
- 内存荒打到结账页:小米等手机涨价 200-1000 元 — tengyanAI · 2026-09-17
- Burkov 批 OpenRouter 不可靠:双模型 fallback 同时失败 — burkov · 2026-09-17
- Common Crawl 爬虫归档实验性上线 Hugging Face,附使用入门指南 — vanstriendaniel · 2026-09-17
- Anthropic 澳洲签下 320 亿澳元数据中心,Claude 首次落地澳洲 — ocean_protocol · 2026-09-17
- Google AI Edge Gallery 上架 Mac,Gemma 4 12B 可跑 16GB MacBook Air — GlennCameronjr · 2026-09-17