TRL 推出异步强化学习训练器,耗时缩短至四分之一
QGallouedec · x · 2026-08-13
Hugging Face 的 TRL 库推出 AsyncGRPOTrainer,通过异步强化学习(RL)显著提升大模型训练效率。
该训练器将生成与训练过程解耦:后台工作线程从 vLLM 服务器流式传输生成结果,同时训练循环直接消费这些数据。在 sail/Sanity-Test-R1D-1.5B 基准测试中,该方法在保持相同奖励曲线的前提下,将实际运行时间缩短了 3.8 倍,并减少了 1.9 倍的 GPU 计算时数。
所属事件:Hugging Face TRL推出异步GRPO训练器,速度提升4倍(3 条相关)→
「研究」频道最新
- 腾讯开源 SCoPE:精准控制视频生成镜头轨迹 — _akhaliq · 2026-08-14
- LTX-2.5 视频生成翻车分析:VTR 压缩机制导致快速运动画面崩坏 — cocktailpeanut · 2026-08-14
- 自研记忆工具登顶:LoCoMo基准实测超微软Memora — corbymatt · 2026-08-14
- 稀疏化不仅省算力还涨点:Un-0模型消除98%连接并提升性能 — NaveenGRao · 2026-08-14
- DeepSeek 突破智能体持续学习,推出支持运行时热插拔框架 — teortaxesTex · 2026-08-14
- DeepMind 研究员呼吁资助大规模开放式智能体实验 — jparkerholder · 2026-08-14