TRL 异步 GRPO 支持 LoRA,训练 500 步耗时从 3.5 小时降至 53 分钟
SergioPaniego · x · 2026-09-22
Hugging Face 团队宣布 TRL 的 AsyncGRPOTrainer 已支持 LoRA(TRL v1.14,PR #7017),并发布长文实测。要点:
- 训练只更新 LoRA adapter(几 MB),而非数 GB 的完整模型,权重同步从 NCCL 传输简化为文件同步;文中引 Thinking Machines 的 LoRA Without Regret:rank-1 adapter 即可支撑策略梯度 RL。
- 架构:3 个 HF Jobs(1 个 trainer + 2 个 vLLM 推理副本)分跑在不同机器,通过同时挂载到三方的 Storage Bucket 传递 adapter。
- 副本前置一个代理,负责加 auth header、把每个 rollout 路由到已持有其 KV prefix 的副本,并向所有副本广播 adapter 加载。
- AsyncGRPO 指标可定位瓶颈;同一配方 5 次迭代优化后,500 步训练从 3 小时 27 分降至 53 分钟。
「Infra」频道最新
- 博主提醒:非美国用户应考虑本地部署 AI,以防政府禁令 — TheMoonMidas · 2026-09-22
- Engram:本地加密记忆库统一各 AI 工具的 agent 记忆 — Acceptable_Leg3950 · 2026-09-22
- DigitalOcean Managed Agents 公测:闲置暂停、按秒计费 — damianplayer · 2026-09-22
- Subconscious 获 510 万美元融资,专做长程 Agent 推理平台 — CShorten30 · 2026-09-22
- Nscale 拟赴美上市估值 350 亿美元,Clegg 或获利 4000 万 — nordicinst · 2026-09-22
- NVIDIA 送出 DGX Spark 首晒:1.2kg 小机身、128GB 统一内存可本地跑 200B 模型 — kimmonismus · 2026-09-22