AWS 推出 HyperPod 推理网关:GPU 感知路由,首 token 延迟最多降 82%
AWS ML Blog · rss · 2026-09-18
AWS 官方博客发布 SageMaker HyperPod Inference Gateway,一个 Kubernetes 原生、GPU 感知的推理路由系统,以单个 EKS 托管插件安装,无需改动应用代码。传统 round-robin 负载均衡看不到 GPU 内部状态(KV cache 饱和、LoRA 适配器驻留、请求队列),导致流量高峰下首 token 延迟飙到 4 秒以上;官方实测中 4.4 秒的首 token 延迟降到 800ms 以内,最多降低 82%。
架构分两层:第一层是集群内网关,由 Envoy Gateway(HTTPS 终止)、Body-Based Router(解析 OpenAI 兼容请求的 model 字段做多模型路由)和 Endpoint Picker 组成;EPP 消费 Prometheus 实时指标,按 KV cache 利用率、队列深度、LoRA 适配器驻留、前缀缓存命中率、运行中请求数等加权打分选最优 pod,各权重可配置。第二层 Global Inference Router 将支持跨集群跨区域故障转移与成本感知调度(即将推出)。
使用上只需三步:aws eks create-addon 装插件、给模型 pod 打标签、声明一个 InferenceGatewayConfig CR,即可暴露标准 OpenAI 兼容端点。它还原生支持 LoRA 适配器亲和路由(避免换载延迟)、多模型路由、分级降级自愈(pod 故障自动摘除、池耗尽返回 429、集群故障 35 秒内切换)和分层可观测性。基准测试覆盖 8B–235B 四个模型、H100 与 A10G 实例,在混合 GPU 代际和突发流量场景下,GPU 感知路由收益最大。
「Infra」频道最新
- Ternary Bonsai 2 WebGPU 内核项目登上 Hugging Face 热榜 — webml-community · 2026-09-18
- 传华为部署 256K 卡 950 SuperCluster,对标美国前沿训练算力 — teortaxesTex · 2026-09-18
- Polymarket 用 Rust 重写网关 API,页面提速 4-8 倍 — Polymarket · 2026-09-18
- 第一颗晶体管与现代晶体管对比图走红 — 0xsachi · 2026-09-18
- 吴恩达、Wozniak 等确认出席 Supabase Select 大会(10 月 2 日旧金山) — dshukertjr · 2026-09-18
- 3500 美元在家跑出「前沿级」模型,开源追平闭源 — 0xSero · 2026-09-18