TRL 推出异步强化学习训练器,耗时缩短至四分之一

QGallouedec · x · 2026-08-13

Hugging Face 的 TRL 库推出 AsyncGRPOTrainer,通过异步强化学习(RL)显著提升大模型训练效率。

该训练器将生成与训练过程解耦:后台工作线程从 vLLM 服务器流式传输生成结果,同时训练循环直接消费这些数据。在 sail/Sanity-Test-R1D-1.5B 基准测试中,该方法在保持相同奖励曲线的前提下,将实际运行时间缩短了 3.8 倍,并减少了 1.9 倍的 GPU 计算时数。

所属事件:Hugging Face TRL推出异步GRPO训练器,速度提升4倍(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →