SGLang 推出权重缓存守护进程,万卡模型重启加速 16 倍
xiaosun86 · x · 2026-08-22
SGLang 联合蚂蚁与阿里推出了 Weight Cache Daemon,通过 CUDA IPC 零拷贝技术将模型权重常驻 GPU 内存。实测在 Ling-2.6-1T FP8 模型上,权重加载从 495 秒降至 0.63 秒,总启动时间从 8.8 分钟缩减至 32 秒,提速约 16 倍。
核心机制:
- 持久化缓存:独立守护进程持有量化后的权重,无需重复磁盘 I/O 和后量化。
- 零拷贝映射:新引擎实例直接映射现有显存,实现毫秒级加载。
- 多实例共享:同一 GPU 上的多引擎实例共享同一份权重,节省显存。
- 高可用支持:支持主备秒级切换和优先级共服务。
该方案是快速引擎恢复框架的首个阶段,旨在实现生产环境下 10 秒级冷重启和 1 秒级热备切换。
「Infra」频道最新
- LLM 提示词存在大量重复计算,缓存潜力巨大 — miniapeur · 2026-08-22
- Agent 循环致上下文膨胀,5% 故障耗掉 25% 成本 — MaverikSh · 2026-08-22
- llama.cpp 发布 v0.2.0,转向语义化版本管理 — PhilippeEiffel · 2026-08-22
- 开源工具 Mark Cleaner:本地移除 AI 文本隐形水印与元数据 — VraserX · 2026-08-22
- 预训练数据重复浪费算力?ICML论文揭示大模型更耐重复 — heghbalz · 2026-08-22
- Marin开源23万亿token预训练数据,可公开下载 — joecole · 2026-08-22