AWS 推出 HyperPod 推理网关:GPU 感知路由,首 token 延迟最多降 82%

AWS ML Blog · rss · 2026-09-18

AWS 官方博客发布 SageMaker HyperPod Inference Gateway,一个 Kubernetes 原生、GPU 感知的推理路由系统,以单个 EKS 托管插件安装,无需改动应用代码。传统 round-robin 负载均衡看不到 GPU 内部状态(KV cache 饱和、LoRA 适配器驻留、请求队列),导致流量高峰下首 token 延迟飙到 4 秒以上;官方实测中 4.4 秒的首 token 延迟降到 800ms 以内,最多降低 82%。

架构分两层:第一层是集群内网关,由 Envoy Gateway(HTTPS 终止)、Body-Based Router(解析 OpenAI 兼容请求的 model 字段做多模型路由)和 Endpoint Picker 组成;EPP 消费 Prometheus 实时指标,按 KV cache 利用率、队列深度、LoRA 适配器驻留、前缀缓存命中率、运行中请求数等加权打分选最优 pod,各权重可配置。第二层 Global Inference Router 将支持跨集群跨区域故障转移与成本感知调度(即将推出)。

使用上只需三步:aws eks create-addon 装插件、给模型 pod 打标签、声明一个 InferenceGatewayConfig CR,即可暴露标准 OpenAI 兼容端点。它还原生支持 LoRA 适配器亲和路由(避免换载延迟)、多模型路由、分级降级自愈(pod 故障自动摘除、池耗尽返回 429、集群故障 35 秒内切换)和分层可观测性。基准测试覆盖 8B–235B 四个模型、H100 与 A10G 实例,在混合 GPU 代际和突发流量场景下,GPU 感知路由收益最大。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →