AWS 年内推 13 项 SageMaker 推理更新,启动延迟最高降 65%
AWS ML Blog · rss · 2026-09-19
AWS ML Blog 盘点了 2026 年迄今 Amazon SageMaker AI 在推理侧发布的 13 项新能力,覆盖托管 Endpoints 与 Kubernetes 原生的 HyperPod Inference 两条部署路径。
两条路径对比:Endpoints 全托管、按实例计费、适合快速上线;HyperPod Inference 提供节点级控制,支持 Karpenter/KEDA 扩缩、gRPC 与自定义负载均衡,适合 train-to-serve 与混合云。
Endpoints 侧主要发布:
- 推理推荐与基准测试(4月):自动在 1000+ 实例/容器组合中收敛配置,应用 EAGLE 3.0 投机解码、kernel 调优、张量并行,并用 NVIDIA AIPerf 做多轮置信度验证;示例中 GPT-OSS-20B 在同等延迟下吞吐翻倍,且推荐功能免费。
- 容量感知实例池(5月):最多配置 5 个备选实例类型,创建、扩容、缩容时自动降级/回迁,解决单一实例类型缺容导致端点彻底失败的问题。
- OpenAI 兼容 API(5月):/openai/v1 路径支持流式 Chat Completions,改个 endpoint URL 即可迁移,bearer token 认证替代 SigV4,已在 14 个区域上线,支持 vLLM/SGLang 容器。
- 容器缓存(6月):扩容新实例免拉镜像,Qwen3-8B 案例中端到端启动从 525 秒降到 258 秒(-51%),早期客户实测改善 38%-65%。
HyperPod 侧:简化 Operator、分层 KV Cache、数据捕获、非聚合 Prefill/Decode 分离、模型缓存等性能特性。整体看,AWS 正把推理冷启动、容量弹性、可观测性这些生成式 AI 推理的硬骨头逐个补齐。
「Infra」频道最新
- 12GB 显存跑 128k 上下文 MoE:两天实测数据与意外结论 — HomoAgens1 · 2026-09-19
- Joseph Suarez 用消费级显卡 5 小时在仓库跑出 SOTA — yacineMTB · 2026-09-19
- MiMo RL 直播算账:infra 重启浪费 33% 有效算力,损失超 40 万美元 — dustinvtran · 2026-09-19
- Jev 类模型无解码循环、有界输出,或成端侧设备的近乎免费判断原语 — signulll · 2026-09-19
- Pedro Domingos:反对数据中心就是让国家变蠢 — pmddomingos · 2026-09-19
- Pedro Domingos:OpenAI 与 Anthropic 真正的护城河是算力储备 — pmddomingos · 2026-09-19