vLLM v0.31.0 发布:717 个提交,vllm preload 让量化权重常驻显存免重启
lmoroney · x · 2026-10-07
vLLM v0.31.0 发布,包含来自 307 位贡献者的 717 个提交,重点解决重启后重新加载大量化权重的等待问题:
- vllm preload:启动守护进程,让量化后的权重跨引擎重启常驻 GPU 显存,附带 /health 端点和就绪等待。
- 实验性快照:基于 CRIU,可在单 GPU 上恢复完全初始化的引擎。
- 破坏性变更:在线量化的 quantization="fp8" 改为 fp8pertensor;tokenizermode="slow" 被移除;per-request 的 mmprocessorkwargs 和 mediaiokwargs 默认拒绝,需加 --trust-request-mm-kwargs。
作者提醒升级生产服务器前,先检查启动脚本和请求代码中的相关参数。
「Infra」频道最新
- Beff Jezos:解耦推理是未来,异构算力云正当其时 — beffjezos · 2026-10-07
- NVIDIA 发布 LoGRA:低秩梯度草图把 LLM 强化学习训练内存最高省 45.7% — nvidia · 2026-10-07
- 前 NVIDIA 工程师爆料:一颗内存控制器报废的芯片如何靠 L2 完成测试 — blelbach · 2026-10-07
- 谁承担资金风险谁有议价权:从押金结构看 AI 算力真稀缺在哪 — tengyanAI · 2026-10-07
- AI 爬虫日刷 12 万请求压垮网站,站长怒封 ClaudeBot 一族 — burkov · 2026-10-07
- Stigg CEO:每家 AI 公司都在不小心造一家银行 — AI Engineer · 2026-10-07