Ai2 换掉优先级调度器:30 天实测拿到 98% 应得 GPU 时长

allen_ai · x · 2026-10-09

Ai2 的 AI Infrastructure 团队撰文介绍其 GPU 集群调度器的设计决策与上线经验。他们把调度目标拆成四层金字塔指标:可用性(硬件健康可用的时间比例)、占用率(可用时间中分配给具体工作负载的比例)、影响力(高价值工作负载被选中的频率)、利用率(工作负载生命周期内 GPU 容量被使用的比例)。

背景:Ai2 管理数千块 NVIDIA H100、B200、B300,集群规模 88 到 1024 块 GPU,服务约 150 名内部研究员,覆盖 LLM/VLM 训练、机器人 RL 仿真、科学 agentic 后训练等。需求长期是供给的 2-3 倍。

他们用「GPU 时间预算 + 分层公平分配 + 时间切片契约」替换了原来的优先级调度器,把「每个项目该分多少 GPU 时间」从逐案运营决策变成透明的行政预算流程。30 天测试中,团队拿到了应得 GPU 时长的 98%(按实际需求计),集群占用率保持 98%,空闲容量可供可中断任务使用且不消耗团队预算。

所属事件:Ai2 重构 GPU 调度器,千卡集群排队等待从 5 分钟降至 24 秒(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →