SageMaker 前缀感知路由上线:P50 TTFT 最多降 77%
AWS ML Blog · rss · 2026-09-11
Amazon SageMaker Inference 推出 PREFIXAWARE 路由:按请求开头的文本内容把共享同一前缀的请求 consistently 送到同一实例,让 KV cache 真正攒热。在 Llama 3.1 70B、7 台 p5.48xlarge、vLLM 的测试中,8000 token 共享前缀的长上下文负载 P50 TTFT 降低 71–77%、吞吐提升 15–16%、KV cache 命中率从约 25% 升到 82%;短上下文(ShareGPT 式)收益较小(P50 降 13–16%)。
机制与保障:
- 无需打标签,端点直接按 payload 开头做亲和路由;
- 过载保护:目标实例达到 ConcurrencyThreshold(1–1024)上限时自动溢出到空闲实例,宁可丢一次缓存命中;
- 扩缩容稳定:加减实例时大部分流量仍留在原实例,缓存不失效。
配置上,PrefixLength 取 1024–65536(原生 API 按字节、OpenAI 兼容 API 按字符计),需覆盖共享前缀并留出足够区分度。路由本身开销仅 1.3–1.9ms。适用场景:RAG(同文档多提问)、多轮对话、模板化指令 bot、代码补全。与前两种策略(RANDOM、LEASTOUTSTANDINGREQUESTS)可随时切换,无需重新部署。
「Infra」频道最新
- k3报告细节:数百万并发沙盒的RL训练规模确认 — stochasticchasm · 2026-09-11
- 五角大楼拟向 AI 云初创 Fluidstack 提供约 50 亿美元贷款 — vitaliychiley · 2026-09-11
- Eric Schmidt:AI 的真正瓶颈不是电力而是钱,万亿美元资本难筹 — rohanpaul_ai · 2026-09-11
- SpaceX 再签 AI 算力大单:月入 11.1 亿美元,年化 ARR 冲 1000 亿 — NinaDSchick · 2026-09-11
- Carmack:Jetson Thor 128GB 内存对实时机器人是过度配置 — ID_AA_Carmack · 2026-09-11
- YC Demo Day 钻石晶圆初创揽 1.6 亿美元意向订单,挑战硅基芯片 — ycombinator · 2026-09-11