HyperPod 模型缓存上线:大模型冷启动从 30 分钟降到秒级
AWS ML Blog · rss · 2026-09-11
Amazon SageMaker HyperPod 推出模型缓存:把模型权重和推理容器镜像预载到节点的本地 NVMe(约 7GB/s),pod 启动即可秒级服务,而不是等 30 分钟以上的网络下载。冷启动原本由两段串行下载主导:多 GB 的推理镜像(5–7 分钟)+ 权重(145GB 模型 20+ 分钟,DeepSeek-R1 600+GB 要 30 分钟以上),每次扩容都要重演。
功能拆成两个可独立开启的缓存:
- 权重缓存:operator 提前把权重从 S3/FSx/HF Hub 下到各节点 NVMe,节点标为 cache-ready 后才建部署,pod 重启后缓存仍在;
- 镜像缓存:DaemonSet 预拉镜像,省掉 ECR 下载,多个部署共享同一缓存。
调度采用 preferred 而非 required:pod 优先落有缓存的节点,落在无缓存节点则回退到正常下载,不会失败。通过 modelCacheConfig(weightsCache/imageCache)即可启用,模型源更新时自动滚动新缓存、清理旧缓存,实现零停机。
「Infra」频道最新
- DeepSeek 发布 V4.1-Flash:百万 token 上下文,KV 缓存缩小 4 倍 — matlabulous · 2026-09-11
- 8GB 显存还能干嘛?网友求解小模型现状与推荐 — riceinmybelly · 2026-09-11
- 西班牙新规要求 80% 逐小时绿电匹配,数据中心建设或耗资千亿欧元 — eherrerosj · 2026-09-11
- Draghi 引用 ECB 研究:AI 或每年提振欧洲生产率 0.3-0.4 个百分点 — rohanpaul_ai · 2026-09-11
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11
- 斯坦福论文:本地+云端混合路由可省 60%-80% 算力成本 — rohanpaul_ai · 2026-09-11