Hugging Face TRL 重大提速:AsyncGRPO 训练步最高快 3.5 倍

ben_burtenshaw · x · 2026-09-23

开发者正为 Hugging Face TRL 中的 AsyncGRPO 做重大性能优化,训练步目前已提速至最高 3.5 倍。

核心思路:在 GRPO 中,同一条 prompt 会采样 G 次,multi-turn rollout 在工具调用场景下对话历史大部分相同、只有后缀不同。优化利用 message-level tokenization 让多条 rollout 共享长前缀,并通过样本打包(sample packing)把注意力开销均衡分配到各 DP rank 上,从而大幅降低重复计算。

AsyncGRPO 此前已包含多项打包优化,这次改进进一步压缩了 rollout 阶段的冗余成本。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →