Snowflake Semi-Persistence:共享 GPU 多模型换载提速最高 19.9 倍

StasBekman · x · 2026-09-01

Snowflake AI Research 提出 Semi-Persistence 方案,解决共享 GPU 上服务多个模型的老问题:全量常驻浪费 GPU 容量,换载又必须快到不阻塞服务路径。

做法是把模型权重保存在 pinned CPU 内存池中,GPU 上的副本视为临时缓存;需求回来时,权重经 PCIe 和 NVLink 并行流回 GPU。在 2B 到 397B 参数的多档模型上,内部基准显示睡眠/唤醒周期比基线 vLLM 路径快 5.6 到 19.9 倍;单 GPU 模型的换载延迟可达亚秒级。

所属事件:Snowflake提出Semi-Persistence方案,共享GPU多模型换载提速近20倍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →