新论文拆解 RL 训练的 batch 迷思:吞吐涨 2.29 倍不等于学得更快

teortaxesTex · x · 2026-09-03

一篇关于 LLM 强化学习中 batch scaling 的新论文指出,很多人看到 GPU 利用率低就习惯性调大 batch size,其实是在混淆系统吞吐与算法效率。作者把两者分开分析:自回归 rollout 生成在低并发下受内存带宽限制,加大 batch 能带来立竿见影的吞吐提升(固定硬件上最高 2.29×),但每步消耗的样本数也大幅增加,学习效率反而被牺牲。论文给出的经验法则是:只有当吞吐提升足以抵消每步样本成本时,加大 batch 才真正缩短墙钟时间。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →