GPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈

burkov · x · 2026-09-30

用强化学习提升 LLM 推理能力目前受硬件与算法双重瓶颈制约:生成阶段模型产出长度差异很大的多步推理长响应,而标准训练更新要求 batch 内所有响应都完成才能更新参数,短响应闲置等待最长响应,导致 GPU 在生成周期中有 70%–74% 时间空闲。微软研究院的论文提出 SortedRL,一个在线的长度感知调度系统,在不破坏 RL 训练稳定性的前提下加速训练并提升学习效率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →