Hugging Face TRL 推出异步 GRPO 训练器,速度提升 2-4 倍

_lewtun · x · 2026-08-13

Hugging Face 的 TRL 库引入了全新的 AsyncGRPOTrainer。该训练器实现了相同的 GRPO 算法,但将 rollout 生成与训练过程解耦。

所属事件:Hugging Face TRL推出异步GRPO训练器,速度提升4倍(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →