Ai2 重构 GPU 调度器,千卡集群排队等待从 5 分钟降至 24 秒
Allen Institute for AI(Ai2)公开其 GPU 调度器的工程设计与上线经验。团队管理数千块 H100/B200/B300,集群规模 88-1024 卡,服务约 150 名研究员。旧调度器因优先级激励机制失衡,任务最终都升级为 HIGH,部分研究员挂空闲任务占住 GPU。新方案将调度目标拆成可用性、占用率等四层金字塔指标,上线后 H100 集群排队中位等待从 5 分钟降到 24 秒,30 天实测研究员拿到 98% 应得 GPU 时长。
2026-10-09 ~ 2026-10-09 · 3 条相关
- Ai2 开源 GPU 调度器:H100 集群排队中位等待从 5 分钟降到 24 秒 — allen_ai · 2026-10-09
- Ai2 重建 GPU 调度器:千卡集群排队中位数从 5 分钟降到 24 秒 — allen_ai · 2026-10-09
- Ai2 换掉优先级调度器:30 天实测拿到 98% 应得 GPU 时长 — allen_ai · 2026-10-09