腾讯混元扩展临界批次理论,RL训练提速29%

腾讯混元团队发布新研究,将经典的 critical batch size 理论扩展到在线 LLM 强化学习场景:模型自产训练数据,rollout 生成与训练的扩展规律不同步。实验显示通过调整学习率来扩大 batch size,GRPO 训练提速 29%,PPO 生成吞吐最高提升至 2.29 倍,为在线 RL 训练提供了新的调参依据。

2026-09-24 ~ 2026-09-24 · 2 条相关