Hugging Face TRL推出异步GRPO训练器,速度提升4倍

Hugging Face的TRL库推出了全新的异步强化学习训练器AsyncGRPOTrainer。该训练器在实现相同GRPO(组相对策略优化)算法的基础上,创新性地将rollout生成与训练过程解耦。通过后台工作线程异步处理生成任务,新方法有效打破了原有的效率瓶颈。基准测试表明,该异步训练器能将大模型的训练耗时大幅缩短,带来约2到4倍的整体速度提升。

2026-08-13 ~ 2026-08-13 · 3 条相关