Ai2 开源 GPU 调度器:H100 集群排队中位等待从 5 分钟降到 24 秒
allen_ai · x · 2026-10-09
Allen AI(Ai2)分享其研究团队算力分配的新调度方案。旧调度器的问题是激励机制失衡:任何计划任务最终都会升级为 HIGH 优先级,部分研究员甚至挂着空闲任务占住 GPU 为后续实验预留资源,导致算力被无活跃任务锁定。
新调度器上线后,在 Ai2 最大的 H100 集群上,排队等待中位数从 5 分钟降到 24 秒。帖子附完整工程细节线程,是研究机构内部算力治理的少见一手复盘。
所属事件:Ai2 重构 GPU 调度器,千卡集群排队等待从 5 分钟降至 24 秒(3 条相关)→
「Infra」频道最新
- KOL 预测:数据中心将成 SpaceX 最大收入来源,剑指万亿美元 — Dr_Singularity · 2026-10-10
- .lan 顶级域名新申请敲警钟,内网服务慎用伪本地域名 — evilsocket · 2026-10-10
- 把字节火山引擎与阿里云加入生成式 AI 采购对比图 — Miles_Brundage · 2026-10-10
- Krueger 新论文:把模型「硬固化」进芯片,改造而非拆除算力链 — DavidSKrueger · 2026-10-10
- TokenSpeed 刷新 Kimi K3 在 AMD 上的速度纪录:比 ATOM 快 1.4 倍 — zhyncs42 · 2026-10-10
- SemiAnalysis:Rubin 搭 vLLM 每吉瓦利润较 GB300 NVL72 高 3.2 倍 — woosuk_k · 2026-10-10