Hugging Face TRL 重大提速:AsyncGRPO 训练步最高快 3.5 倍
ben_burtenshaw · x · 2026-09-23
开发者正为 Hugging Face TRL 中的 AsyncGRPO 做重大性能优化,训练步目前已提速至最高 3.5 倍。
核心思路:在 GRPO 中,同一条 prompt 会采样 G 次,multi-turn rollout 在工具调用场景下对话历史大部分相同、只有后缀不同。优化利用 message-level tokenization 让多条 rollout 共享长前缀,并通过样本打包(sample packing)把注意力开销均衡分配到各 DP rank 上,从而大幅降低重复计算。
AsyncGRPO 此前已包含多项打包优化,这次改进进一步压缩了 rollout 阶段的冗余成本。
「Infra」频道最新
- AI 竞赛转向效率战:DeepSeek、Kimi、Qwen、GLM 比拼每瓦智能 — ingliguori · 2026-09-23
- 印度芯片封装商用化启动,Tata 135亿美元建 Dholera 晶圆厂 — shashib · 2026-09-23
- DeepSeek V4.1 Flash 本地跑上 128GB Strix Halo,单机流式或双机分布式 — antirez · 2026-09-23
- 曝 Anthropic 洽谈直接租赁 1GW 数据中心,或填装谷歌 TPU — mark_k · 2026-09-23
- 高通发布两款端侧 AI 芯片:Hexagon NPU 专为本地 MoE 模型设计 — emmanuelvivier · 2026-09-23
- Go.AI 融资 8500 万美元,为银行与医疗提供开箱即用本地 AI — emmanuelvivier · 2026-09-23