HAMi + SGLang 教程:用 GPU 共享配额在 K8s 上跑推理,显存与算力双重限制
HowDevelop · x · 2026-09-04
HowDevelop 与 rudrakshkarpe 发布完整实验教程(Lab 15),演示在已有 NVIDIA GPU 的 Kubernetes 集群上安装 HAMi 调度器,并以 GPU 共享方式运行 SGLang 推理服务:
- HAMi 通过 nvidia.com/gpumem(软件级显存配额)和 nvidia.com/gpucores(算力节流)实现 Pod 级 GPU 资源切分,不依赖云厂商
- 要求至少一块可用显存超 25000 MiB 的 GPU 节点(教程用 H100 80GB,A10 需下调配额)
- 部署完成后得到 OpenAI 兼容 API,可用 /v1/models 和 /v1/chat/completions 验证,并确认 gpumem 限制在 Pod 内实际生效
- 涵盖 Helm 安装 HAMi、节点打标签、端口转发测试等完整步骤,约 45 分钟可复现
「Infra」频道最新
- 弗州官方研究:数据中心用水与大型写字楼相当 — GlenBradley · 2026-09-04
- 弗州官方研究:多数数据中心用水量与大型办公楼相当 — GlenBradley · 2026-09-04
- 推理平台 Lighter 使用量暴涨,8 月月报总结走红 — econoar · 2026-09-04
- NVIDIA 主导的开源安全联盟 OSAA 移交 Linux 基金会 — CackleRooster · 2026-09-04
- AI 数据中心或让当地电价更便宜:大税户摊薄固定输配电成本 — alexvoica · 2026-09-04
- Qwen 3.8 27B 上线 Cerebras,推理速度达 1500 tokens/秒 — altertable · 2026-09-04