AWS 推出分布式 KV 缓存架构,TTFT 最高提升 2.7 倍
AWS ML Blog · rss · 2026-08-12
AWS 介绍了一种在 SageMaker HyperPod 上构建的分层 KV 缓存架构,通过跨节点共享缓存解决大模型推理的显存瓶颈与冷启动问题。
三层缓存设计
- L0 (GPU 显存):vLLM 原生的页注意力层,访问延迟最低。
- L1 (主机内存):当 GPU 缓存满时,溢出的数据被捕获到节点本地内存中。
- L2 (分布式 NVMe 池):引入轻量级分布式缓存文件系统 Curvine,将各节点的本地 NVMe 盘池化共享,使不同推理副本能直接复用 KV 缓存。
配合 HyperPod 的智能路由策略(感知前缀或 KV 状态),该架构实现了高达 100% 的跨节点缓存命中率。测试显示,对于约 1900 token 的提示词,首字延迟 (TTFT) 提升达 2.7 倍,跨节点读取延迟仅约 56 毫秒。这使得许多原本依赖昂贵 P5 实例的工作负载可以降级到低成本的 G6e 实例运行。
「Infra」频道最新
- 英伟达正加速打造“合成超大规模云厂商” — firstadopter · 2026-08-12
- Keras 后端无关性优势:Expedia 大规模模型摆脱 TF 锁定 — fchollet · 2026-08-12
- 专家警示:6英寸晶圆无法完全解决光通信规模化制造难题 — BenBajarin · 2026-08-12
- AI算力热潮推高概念股,TL20指数年内涨幅达59% — TiernanRayTech · 2026-08-12
- Vercel 实战:每分钟 6000 次部署下如何平滑迁移核心数据库 — evilrabbit_ · 2026-08-12
- 分析师:服务器 CPU 市场即将迎来前所未有的 S 型曲线跃升 — BenBajarin · 2026-08-12