Ai2 换掉优先级调度器:30 天实测拿到 98% 应得 GPU 时长
allen_ai · x · 2026-10-09
Ai2 的 AI Infrastructure 团队撰文介绍其 GPU 集群调度器的设计决策与上线经验。他们把调度目标拆成四层金字塔指标:可用性(硬件健康可用的时间比例)、占用率(可用时间中分配给具体工作负载的比例)、影响力(高价值工作负载被选中的频率)、利用率(工作负载生命周期内 GPU 容量被使用的比例)。
背景:Ai2 管理数千块 NVIDIA H100、B200、B300,集群规模 88 到 1024 块 GPU,服务约 150 名内部研究员,覆盖 LLM/VLM 训练、机器人 RL 仿真、科学 agentic 后训练等。需求长期是供给的 2-3 倍。
他们用「GPU 时间预算 + 分层公平分配 + 时间切片契约」替换了原来的优先级调度器,把「每个项目该分多少 GPU 时间」从逐案运营决策变成透明的行政预算流程。30 天测试中,团队拿到了应得 GPU 时长的 98%(按实际需求计),集群占用率保持 98%,空闲容量可供可中断任务使用且不消耗团队预算。
所属事件:Ai2 重构 GPU 调度器,千卡集群排队等待从 5 分钟降至 24 秒(3 条相关)→
「Infra」频道最新
- KOL 预测:数据中心将成 SpaceX 最大收入来源,剑指万亿美元 — Dr_Singularity · 2026-10-10
- .lan 顶级域名新申请敲警钟,内网服务慎用伪本地域名 — evilsocket · 2026-10-10
- 把字节火山引擎与阿里云加入生成式 AI 采购对比图 — Miles_Brundage · 2026-10-10
- RTX 3060+16GB 内存跑 68GB Qwen MoE 提速 10-15 倍,输出比特级一致 — zyxciss · 2026-10-10
- Krueger 新论文:把模型「硬固化」进芯片,改造而非拆除算力链 — DavidSKrueger · 2026-10-10
- TokenSpeed 刷新 Kimi K3 在 AMD 上的速度纪录:比 ATOM 快 1.4 倍 — zhyncs42 · 2026-10-10