Ai2 重建 GPU 调度器:千卡集群排队中位数从 5 分钟降到 24 秒

allen_ai · x · 2026-10-09

Ai2(Allen Institute for AI)公开其 GPU 调度器的工程设计。团队管理数千块 H100/B200/B300,集群规模 88–1024 卡,服务约 150 名内部研究员,而任意时刻的 GPU 需求都是供给的 2–3 倍。

他们将调度目标分为四层金字塔:可用性 → 占用率 → 影响力 → 利用率。近期他们用一套包含 GPU 时间预算、分层公平份额分配与时间切片契约的系统替换了旧的优先级调度器,把「每个项目该分多少卡」的争论从逐案运营问题变成透明的预算流程。在最大的 H100 集群上,排队等待中位数从 5 分钟降至 24 秒。

所属事件:Ai2 重构 GPU 调度器,千卡集群排队等待从 5 分钟降至 24 秒(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →