多团队共享 GPU 集群:AWS 发布 HyperPod 多租户参考架构

AWS ML Blog · rss · 2026-10-09

要解决的问题

企业内多个团队(如训练 LLM 的数据科学团队、跑推理的 CV 团队、做架构实验的研究团队)需要共享昂贵的 GPU 集群,但没有良好多租户设计时会出现资源失控、隔离弱、成本无法分摊、管理开销大等问题。

方案概览

Amazon SageMaker HyperPod 是专为生成式 AI 工作负载设计的大规模算力集群服务,由 EKS 或 Slurm 编排,自动处理节点健康监测、故障恢复与集群生命周期。本文给出基于 HyperPod + EKS 的多租户参考架构,核心组件包括:

效果

该架构从认证、授权到工作负载执行全链路隔离团队,同时高效共享 GPU 基础设施,并支持命名空间级别的成本分摊与计费回流(chargeback)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →