腾讯混元扩展 critical-batch-size 理论:GRPO 训练提速 29%,PPO 生成吞吐达 2.29×
TencentHunyuan · x · 2026-09-24
腾讯混元团队发布新研究,把经典的 critical batch size 理论扩展到在线 LLM 强化学习场景——模型自产训练数据,rollout 生成与训练的扩展规律不同。关键发现:
- 在 GRPO 与 PPO 上,通过重调学习率,可在有限 batch size 范围内保持每条 response 的学习量。
- 固定硬件下,batch size 增大可使 PPO 生成阶段吞吐提升最高 2.29×。
- 最优 GRPO 配置达到相同验证指标的时间缩短 29%。
研究对大规模 GPU 集群 RL 训练的效率优化有直接参考价值。
所属事件:腾讯混元扩展临界批次理论,RL训练提速29%(2 条相关)→
「Infra」频道最新
- 曝 Modal 与 Baseten 正洽谈融资,助企业运行 AI 负载 — dinabass · 2026-09-24
- 哥伦比亚大学 CUbiC 论文探讨边缘到云 AI 基础设施与 CPO 路线 — jwt0625 · 2026-09-24
- 混元研究:调学习率扩大 batch size,PPO 训练吞吐提升至 2.29 倍 — TencentHunyuan · 2026-09-24
- Alchemy 为状态存储加 Cloudflare Access 保护,支持 CI 服务令牌 — samgoodwin89 · 2026-09-24
- 一条 prompt 让 agent 自己核算账单:价格涨还是用量涨? — gethackteam · 2026-09-24
- 内核启动 50μs 延迟的代价:通用推理框架难以复刻单模型专有优化 — AlpinDale · 2026-09-24