AWS 年内推 13 项 SageMaker 推理更新,启动延迟最高降 65%

AWS ML Blog · rss · 2026-09-19

AWS ML Blog 盘点了 2026 年迄今 Amazon SageMaker AI 在推理侧发布的 13 项新能力,覆盖托管 Endpoints 与 Kubernetes 原生的 HyperPod Inference 两条部署路径。

两条路径对比:Endpoints 全托管、按实例计费、适合快速上线;HyperPod Inference 提供节点级控制,支持 Karpenter/KEDA 扩缩、gRPC 与自定义负载均衡,适合 train-to-serve 与混合云。

Endpoints 侧主要发布:

HyperPod 侧:简化 Operator、分层 KV Cache、数据捕获、非聚合 Prefill/Decode 分离、模型缓存等性能特性。整体看,AWS 正把推理冷启动、容量弹性、可观测性这些生成式 AI 推理的硬骨头逐个补齐。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →