SGLang 推出权重缓存守护进程,万卡模型重启加速 16 倍

xiaosun86 · x · 2026-08-22

SGLang 联合蚂蚁与阿里推出了 Weight Cache Daemon,通过 CUDA IPC 零拷贝技术将模型权重常驻 GPU 内存。实测在 Ling-2.6-1T FP8 模型上,权重加载从 495 秒降至 0.63 秒,总启动时间从 8.8 分钟缩减至 32 秒,提速约 16 倍。

核心机制:

该方案是快速引擎恢复框架的首个阶段,旨在实现生产环境下 10 秒级冷重启和 1 秒级热备切换。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →