GPU 空转高达 74%,微软研究院 SortedRL 直击 RL 训练调度瓶颈
burkov · x · 2026-09-30
用强化学习提升 LLM 推理能力目前受硬件与算法双重瓶颈制约:生成阶段模型产出长度差异很大的多步推理长响应,而标准训练更新要求 batch 内所有响应都完成才能更新参数,短响应闲置等待最长响应,导致 GPU 在生成周期中有 70%–74% 时间空闲。微软研究院的论文提出 SortedRL,一个在线的长度感知调度系统,在不破坏 RL 训练稳定性的前提下加速训练并提升学习效率。
「Infra」频道最新
- 新 AI 实验室找 GPU 该找谁?业内投票 SF Compute 居首 — FinanceYF5 · 2026-09-30
- 谷歌向 CNCF 捐赠 Agent Substrate,剑指智能体运行时底座 — rakyll · 2026-09-30
- AI 芯片热潮推高韩国税收,预计创历史新高 — Polymarket · 2026-09-30
- 政府气象模型 WRF 移植 GPU,速度快一个量级出 250 米分辨率 — Scobleizer · 2026-09-30
- Ubuntu Snapdragon 版 ISO 已开放下载,高通 X2 笔记本可提前体验 — carrycooldude · 2026-09-30
- Canonical 与高通宣布:Ubuntu 将于 2027 年正式支持骁龙 X2 平台,面向本地 Agentic AI — carrycooldude · 2026-09-30