NVIDIA Dynamo Snapshot 将 LLM 扩容冷启动时间降低约 10 倍

Nasereliver · x · 2026-10-01

SysConf 2026 公布的议题介绍:Rasheedat Atinuke Jamiu 将分享用 NVIDIA Dynamo Snapshot 解决 LLM 服务冷启动问题的实验结果。

LLM 推理扩容慢的根源在于新 GPU worker 需要初始化运行时、加载模型权重、准备 kernel 并分配内存。Dynamo Snapshot 的做法是对已初始化的 worker 做快照检查点,新 worker 直接从快照恢复:宿主机状态用 CRIU 保存,GPU 状态用 cuda-checkpoint 保存。

作者基于自己跑的实验给出数据:启动时间下降约 10 倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →