TRL 新增异步 GRPO:经 HF Buckets 同步 LoRA 权重,训练耗时 3.5 小时缩至 53 分钟

_lewtun · x · 2026-09-18

Hugging Face 团队的 Amine Dirhoussi 宣布 TRL 的 AsyncGRPOTrainer 正式支持 LoRA 训练,并通过 HF Buckets 实现跨机器的 RL 权重同步。

关键设计:

这让小团队用 HF Jobs 基础设施就能跑异步 GRPO,trainer、推理、存储全在 HF 生态内完成。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →