TRL 新增异步 GRPO:经 HF Buckets 同步 LoRA 权重,训练耗时 3.5 小时缩至 53 分钟
_lewtun · x · 2026-09-18
Hugging Face 团队的 Amine Dirhoussi 宣布 TRL 的 AsyncGRPOTrainer 正式支持 LoRA 训练,并通过 HF Buckets 实现跨机器的 RL 权重同步。
关键设计:
- 训练 Job 与 vLLM 推理 Job 分跑在不同机器上,无需 NCCL、无需共享磁盘。
- 1.5B 模型只同步几 MB 的 LoRA adapter 增量,adapter 通过 Bucket 挂载到每个 Job 的相同路径。
- 同一 reward 下,整套循环耗时从 3h27 降到 53 分钟。
这让小团队用 HF Jobs 基础设施就能跑异步 GRPO,trainer、推理、存储全在 HF 生态内完成。
「Infra」频道最新
- 博通推 VMware 私有 AI 云,瞄准公有云 AI 账单失控的企业 — DavidLinthicum · 2026-09-18
- 仅 0.05% 采样就能验证缓存,作者感叹整个系统省下的工作量惊人 — DanielLockyer · 2026-09-18
- 支付公司争抢推理入口:Stripe 携 OpenRouter、Ramp 切入推理链 — xkonjin · 2026-09-18
- 开源项目 DataFlow:把预训练前的数据清洗与合成做成可复用流水线 — Puzzleheaded_Box2842 · 2026-09-18
- Qdrant 四小时直播深挖向量搜索,回放已上线 — qdrant_engine · 2026-09-18
- 投资人:QNX 微内核是 Agent 时代被低估的边缘安全护城河 — pdamodaran · 2026-09-18