vLLM 联手微软与英伟达,优化大模型权重加载与 KV 缓存
vllm_project · x · 2026-08-12
vLLM 项目宣布与微软和英伟达合作,优化大模型推理服务的基础设施瓶颈,主要针对模型权重加载和 KV 缓存处理。
- 权重加载:通过 NVIDIA Dynamo ModelExpress 对接 Azure Blob,在 H100/A100 上的加载速度最高提升 7.3 倍。
- KV 缓存:利用 vLLM 的 KV connector 和 LMCACHE,将缓存块存储在 Azure Blob 中。命中缓存时直接拉取数据,避免了昂贵的重计算,且随 prompt 长度增加收益更加显著。
所属事件:vLLM联手微软与英伟达优化大模型推理加载(3 条相关)→
「Infra」频道最新
- SK海力士砸 381 亿美元在韩国新建两座内存晶圆厂 — Beth_Kindig · 2026-08-13
- 新秀推理引擎 Tokenspeed 获 Qwen3.8 Day-0 支持 — This_Maintenance_834 · 2026-08-13
- 推演 DeepSeek V4:超低 API 成本与 SSD KV Cache 革命 — Xianbao_QIAN · 2026-08-13
- Vercel AI Gateway 零加价上线 Grok 与 DeepSeek 模型 — brandon_galang · 2026-08-13
- AI 能耗度量新视角:每 token 能耗需结合质量、任务等多维因素 — prateekj · 2026-08-13
- 实测:单台 DGX Spark 跑 124B 模型达 38.7 tok/s — AcanthisittaOk1699 · 2026-08-13