vLLM v0.29.0 发布:Model Runner V2 成全模型默认,277 人贡献 594 次提交
vllm_project · x · 2026-09-11
vLLM 发布 v0.29.0,由 277 位贡献者(91 位首次参与)的 594 次提交组成,核心变化:
- Model Runner V2 成为所有模型的默认 runner
- Kimi-K3 再度优化,latent tail 下沉到 Mamba metadata 层
- DeepSeek-V4 shared experts 融合进 MegaMoE
- Mamba prefix caching:保留内部 prefill checkpoint,TTFT 提升 925%
- 推测解码通过 API 报告每请求接受率统计
- RL 权重同步新增 shardedrdt P2P 后端,每个 worker 只拉取自己的 TP/EP 分片
- 新模型支持:Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA、NemotronH Omni Reasoning V3
所属事件:vLLM v0.29.0发布:Blackwell延迟降33.6%,277人参与(4 条相关)→
「Infra」频道最新
- KV缓存9个月压缩54倍,DeepSeek被称第三前沿实验室 — max_paperclips · 2026-09-11
- CXMT 激进扩产:至 2028 下半年新建四座 DRAM 晶圆厂 — zephyr_z9 · 2026-09-11
- OpenAI CFO:一年前买的算力如今可溢价 3-5 倍卖出 — rohanpaul_ai · 2026-09-11
- NVIDIA 与 Red Hat 联手 vLLM 设 bounty:33B 以下开源模型实战黑客松 — NVIDIAAI · 2026-09-11
- 开发者质疑 OpenAI prompt_cache_key 设计或致算力大量浪费 — YouJiacheng · 2026-09-11
- SF Compute 签下 2.45 亿美元 Blackwell B300 算力长约 — mattshumer_ · 2026-09-11