SageMaker 前缀感知路由上线:P50 TTFT 最多降 77%

AWS ML Blog · rss · 2026-09-11

Amazon SageMaker Inference 推出 PREFIXAWARE 路由:按请求开头的文本内容把共享同一前缀的请求 consistently 送到同一实例,让 KV cache 真正攒热。在 Llama 3.1 70B、7 台 p5.48xlarge、vLLM 的测试中,8000 token 共享前缀的长上下文负载 P50 TTFT 降低 71–77%、吞吐提升 15–16%、KV cache 命中率从约 25% 升到 82%;短上下文(ShareGPT 式)收益较小(P50 降 13–16%)。

机制与保障:

配置上,PrefixLength 取 1024–65536(原生 API 按字节、OpenAI 兼容 API 按字符计),需覆盖共享前缀并留出足够区分度。路由本身开销仅 1.3–1.9ms。适用场景:RAG(同文档多提问)、多轮对话、模板化指令 bot、代码补全。与前两种策略(RANDOM、LEASTOUTSTANDINGREQUESTS)可随时切换,无需重新部署。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →