腾讯混元扩展 critical-batch-size 理论:GRPO 训练提速 29%,PPO 生成吞吐达 2.29×

TencentHunyuan · x · 2026-09-24

腾讯混元团队发布新研究,把经典的 critical batch size 理论扩展到在线 LLM 强化学习场景——模型自产训练数据,rollout 生成与训练的扩展规律不同。关键发现:

研究对大规模 GPU 集群 RL 训练的效率优化有直接参考价值。

所属事件:腾讯混元扩展临界批次理论,RL训练提速29%(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →