腾讯混元扩展临界批次理论,RL训练提速29%
腾讯混元团队发布新研究,将经典的 critical batch size 理论扩展到在线 LLM 强化学习场景:模型自产训练数据,rollout 生成与训练的扩展规律不同步。实验显示通过调整学习率来扩大 batch size,GRPO 训练提速 29%,PPO 生成吞吐最高提升至 2.29 倍,为在线 RL 训练提供了新的调参依据。
2026-09-24 ~ 2026-09-24 · 2 条相关
- 腾讯混元扩展 critical-batch-size 理论:GRPO 训练提速 29%,PPO 生成吞吐达 2.29× — TencentHunyuan · 2026-09-24
- 混元研究:调学习率扩大 batch size,PPO 训练吞吐提升至 2.29 倍 — TencentHunyuan · 2026-09-24