多团队共享 GPU 集群:AWS 发布 HyperPod 多租户参考架构
AWS ML Blog · rss · 2026-10-09
要解决的问题
企业内多个团队(如训练 LLM 的数据科学团队、跑推理的 CV 团队、做架构实验的研究团队)需要共享昂贵的 GPU 集群,但没有良好多租户设计时会出现资源失控、隔离弱、成本无法分摊、管理开销大等问题。
方案概览
Amazon SageMaker HyperPod 是专为生成式 AI 工作负载设计的大规模算力集群服务,由 EKS 或 Slurm 编排,自动处理节点健康监测、故障恢复与集群生命周期。本文给出基于 HyperPod + EKS 的多租户参考架构,核心组件包括:
- 认证:AWS IAM Identity Center 集中式认证,可联合 Microsoft Entra ID / Okta 等外部身份提供商,支持 SSO 登录 SageMaker Studio 与 CLI(aws sso login 后用 kubectl 提交任务)
- 工作空间:每团队独立的 SageMaker AI domain 与执行角色,提供定制化 Studio GUI
- 隔离:Kubernetes 命名空间做工作负载隔离,EKS access entries 将 IAM 角色映射到团队命名空间级别的 RBAC 权限,Studio 与 CLI 两条路径都被限制在本团队命名空间内
- 公平调度:HyperPod Task Governance 管理计算配额与调度优先级,HyperPod Observability 提供监控看板
- 存储:FSx for Lustre/OpenZFS 提供按团队/按用户划分的共享目录与 home 目录,S3 桶由团队 IAM 角色管控
效果
该架构从认证、授权到工作负载执行全链路隔离团队,同时高效共享 GPU 基础设施,并支持命名空间级别的成本分摊与计费回流(chargeback)。
「Infra」频道最新
- 2800 美元 8 卡 V620 攒 256GB 显存:自改 vLLM 跑 Qwen3.8 达 3000+ t/s 预填充 — _TheWolfOfWalmart_ · 2026-10-09
- Coatue 报告解析算力融资新玩法 — _AustinCalvert_ · 2026-10-09
- RTX 4090 实测四款开源决策模型:Laya 最快,Lev 最准但慢 13 倍 — Fun-Meaning-6474 · 2026-10-09
- fal 工程师谈视频生成提速:H3 Max 五秒渲出 15 秒视频 — OdinLovis · 2026-10-09
- 微软英伟达猛攻本地 AI,或成对抗前沿实验室的防御牌 — MatthewBerman · 2026-10-09
- Eron v1.4 发布:$2.99 买断的原生 iOS 本地模型客户端 — RA2B_DIN · 2026-10-09