混元研究:调学习率扩大 batch size,PPO 训练吞吐提升至 2.29 倍
TencentHunyuan · x · 2026-09-24
腾讯混元新研究把经典的临界 batch size 理论扩展到在线 LLM RL(模型自产训练数据、rollout 生成与训练规模不同步)。结论:
- 在 GRPO 与 PPO 上,重新调整学习率可在有界 batch size 范围内保持每个响应的学习量
- 固定硬件下扩大 batch size,PPO 生成阶段吞吐最高提升 2.29 倍
- 最优 GRPO 配置达到相同验证目标只需少 29% 的时间
对大规模 RL 训练的算力效率有直接参考价值。
所属事件:腾讯混元扩展临界批次理论,RL训练提速29%(2 条相关)→
「Infra」频道最新
- 曝 Modal 与 Baseten 正洽谈融资,助企业运行 AI 负载 — dinabass · 2026-09-24
- 哥伦比亚大学 CUbiC 论文探讨边缘到云 AI 基础设施与 CPO 路线 — jwt0625 · 2026-09-24
- Alchemy 为状态存储加 Cloudflare Access 保护,支持 CI 服务令牌 — samgoodwin89 · 2026-09-24
- 一条 prompt 让 agent 自己核算账单:价格涨还是用量涨? — gethackteam · 2026-09-24
- 内核启动 50μs 延迟的代价:通用推理框架难以复刻单模型专有优化 — AlpinDale · 2026-09-24
- ComfyUI 无损压缩节点:28GB 模型压到 19GB,位级完全一致 — New-Shift6661 · 2026-09-24