Snowflake 新研究:共享 GPU 多模型服务的 Semi-Persistence 方案
bookwormengr · x · 2026-09-01
Snowflake AI Research 发布新成果,引入 CRIU 技术解决共享 GPU 上多模型服务难题。
- 痛点:单模型服务简单,但在共享 GPU 上服务多个模型时,全部常驻加载会浪费 GPU 容量;而换入换出模型只有足够快、不阻塞服务路径才有意义。
- 方案:Semi-Persistence 将模型权重保留在锁定的 CPU 内存(pinned CPU-mem)中,兼顾显存利用率与切换速度。
所属事件:Snowflake提出Semi-Persistence方案,共享GPU多模型换载提速近20倍(2 条相关)→
「Infra」频道最新
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01
- AI 推理需求再暴涨,供给端又被需求「教做人」 — Baconbrix · 2026-09-01
- Warp 创始人预测:所有公司一年内将建立云端协作工厂 — charlieholtz · 2026-09-01
- 算力账本:1GW 基建 450 亿美元,前沿实验室收入约 300 亿 — zephyr_z9 · 2026-09-01
- 数据中心员工现身说法:蓝领最快破六位数的行业 — AICopyLab · 2026-09-01