Hugging Face TRL 推出异步 GRPO 训练器,速度提升 2-4 倍
_lewtun · x · 2026-08-13
Hugging Face 的 TRL 库引入了全新的 AsyncGRPOTrainer。该训练器实现了相同的 GRPO 算法,但将 rollout 生成与训练过程解耦。
- 机制:后台 worker 持续从 vLLM 服务器流式传输生成结果,而训练循环则负责消费这些结果,使得生成与梯度更新能够重叠进行,而非交替执行。
- 性能:根据官方基准测试,这种异步机制能带来约 2-4 倍的速度提升。
- 依赖要求:需要 vllm>=0.22.0 和 transformers>=5.2.0。目前分布式训练仅支持 FSDP2,暂不支持 DeepSpeed ZeRO。
所属事件:Hugging Face TRL推出异步GRPO训练器,速度提升4倍(3 条相关)→
「研究」频道最新
- 腾讯开源 SCoPE:精准控制视频生成镜头轨迹 — _akhaliq · 2026-08-14
- LTX-2.5 视频生成翻车分析:VTR 压缩机制导致快速运动画面崩坏 — cocktailpeanut · 2026-08-14
- 自研记忆工具登顶:LoCoMo基准实测超微软Memora — corbymatt · 2026-08-14
- 稀疏化不仅省算力还涨点:Un-0模型消除98%连接并提升性能 — NaveenGRao · 2026-08-14
- DeepSeek 突破智能体持续学习,推出支持运行时热插拔框架 — teortaxesTex · 2026-08-14
- DeepMind 研究员呼吁资助大规模开放式智能体实验 — jparkerholder · 2026-08-14