NVIDIA 与微软优化 vLLM:H100 权重加载提速 7.3 倍

NVIDIAAI · x · 2026-08-12

NVIDIA 与微软联合为 vLLM 的模型加载器和 KV 连接器引入了 Azure Blob 存储路径支持。由于大模型必须将权重加载至 HBM 显存后才能开始服务,这一优化直击推理启动的瓶颈。通过集成 Dynamo ModelExpress,该方案在 H100 和 A100 上的加载速度最高可达默认方式的 7.3 倍。

所属事件:vLLM联手微软与英伟达优化大模型推理加载(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →