Ai2 开源 GPU 调度器:H100 集群排队中位等待从 5 分钟降到 24 秒

allen_ai · x · 2026-10-09

Allen AI(Ai2)分享其研究团队算力分配的新调度方案。旧调度器的问题是激励机制失衡:任何计划任务最终都会升级为 HIGH 优先级,部分研究员甚至挂着空闲任务占住 GPU 为后续实验预留资源,导致算力被无活跃任务锁定。

新调度器上线后,在 Ai2 最大的 H100 集群上,排队等待中位数从 5 分钟降到 24 秒。帖子附完整工程细节线程,是研究机构内部算力治理的少见一手复盘。

所属事件:Ai2 重构 GPU 调度器,千卡集群排队等待从 5 分钟降至 24 秒(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →