Snowflake Semi-Persistence:共享 GPU 多模型换载提速最高 19.9 倍
StasBekman · x · 2026-09-01
Snowflake AI Research 提出 Semi-Persistence 方案,解决共享 GPU 上服务多个模型的老问题:全量常驻浪费 GPU 容量,换载又必须快到不阻塞服务路径。
做法是把模型权重保存在 pinned CPU 内存池中,GPU 上的副本视为临时缓存;需求回来时,权重经 PCIe 和 NVLink 并行流回 GPU。在 2B 到 397B 参数的多档模型上,内部基准显示睡眠/唤醒周期比基线 vLLM 路径快 5.6 到 19.9 倍;单 GPU 模型的换载延迟可达亚秒级。
所属事件:Snowflake提出Semi-Persistence方案,共享GPU多模型换载提速近20倍(2 条相关)→
「Infra」频道最新
- Google Cloud Monitoring MCP 连接器发布 — modelcontextprotocol · 2026-09-01
- Distributed.systems发布可审计的Agent基础设施 — arthurcolle · 2026-09-01
- ChatGPT 启用记忆和历史会话是否增加 Token 消耗? — ssunki · 2026-09-01
- 工程师深挖 ROCm,修复 MI350X 推理崩溃并发现 9 个 Bug — AnushElangovan · 2026-09-01
- 40nm 神经动力学芯片:利用电导漂移实现单次迭代 2.12ms 延迟 — maier_ak · 2026-09-01
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01