TRL 异步 GRPO 支持 LoRA,训练 500 步耗时从 3.5 小时降至 53 分钟

SergioPaniego · x · 2026-09-22

Hugging Face 团队宣布 TRL 的 AsyncGRPOTrainer 已支持 LoRA(TRL v1.14,PR #7017),并发布长文实测。要点:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →