HyperPod 模型缓存上线:大模型冷启动从 30 分钟降到秒级

AWS ML Blog · rss · 2026-09-11

Amazon SageMaker HyperPod 推出模型缓存:把模型权重和推理容器镜像预载到节点的本地 NVMe(约 7GB/s),pod 启动即可秒级服务,而不是等 30 分钟以上的网络下载。冷启动原本由两段串行下载主导:多 GB 的推理镜像(5–7 分钟)+ 权重(145GB 模型 20+ 分钟,DeepSeek-R1 600+GB 要 30 分钟以上),每次扩容都要重演。

功能拆成两个可独立开启的缓存:

调度采用 preferred 而非 required:pod 优先落有缓存的节点,落在无缓存节点则回退到正常下载,不会失败。通过 modelCacheConfig(weightsCache/imageCache)即可启用,模型源更新时自动滚动新缓存、清理旧缓存,实现零停机。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →