混元研究:调学习率扩大 batch size,PPO 训练吞吐提升至 2.29 倍

TencentHunyuan · x · 2026-09-24

腾讯混元新研究把经典的临界 batch size 理论扩展到在线 LLM RL(模型自产训练数据、rollout 生成与训练规模不同步)。结论:

对大规模 RL 训练的算力效率有直接参考价值。

所属事件:腾讯混元扩展临界批次理论,RL训练提速29%(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →