Hugging Face TRL推出异步GRPO训练器,速度提升4倍
Hugging Face的TRL库推出了全新的异步强化学习训练器AsyncGRPOTrainer。该训练器在实现相同GRPO(组相对策略优化)算法的基础上,创新性地将rollout生成与训练过程解耦。通过后台工作线程异步处理生成任务,新方法有效打破了原有的效率瓶颈。基准测试表明,该异步训练器能将大模型的训练耗时大幅缩短,带来约2到4倍的整体速度提升。
2026-08-13 ~ 2026-08-13 · 3 条相关
- TRL 推出异步强化学习训练器,耗时缩短至四分之一 — QGallouedec · 2026-08-13
- Hugging Face TRL 推出异步 GRPO 训练器,速度提升 2-4 倍 — _lewtun · 2026-08-13
- TRL 新版异步训练器让 GRPO 提速 2-4 倍 — _lewtun · 2026-08-13