vLLM-Omni 发布:KV 复用、FP8 等多项优化加速全模态推理
vllm_project · x · 2026-09-20
vLLM 官方介绍 vLLM-Omni 的底层技术优化,与阿里 Qwen 团队合作完成:
- 跨步骤前缀 KV 复用,避免重复计算文本与参考图像前缀
- 专用 CUDA Graphs,降低固定 shape decode 的启动开销
- 请求级与步骤级连续 batching,带 phase 感知的 prefill/decode 调度
- Tensor 与 Ulysses 序列并行
- 分布式 VAE 解码,带自适应 OOM 恢复
- FP8 权重、FP8 前缀 KV 存储与 CPU offloading,适配不同显存预算
「Infra」频道最新
- OpenAI 硬件 VP 详述首颗自研芯片 Jalapeño:9 个月流片 — bigdata · 2026-09-20
- llama.cpp 分支实现 Declarative Attention,解码耗时降到 0.71× — Ok-Shower7286 · 2026-09-20
- Vulkan 本地训练器 VTrain 修复内存泄漏,更多负载转移至 GPU — Savantskie1 · 2026-09-20
- vLLM 首日支持 Qwen-Image-2.1:KV cache 复用加速推理,附部署指南 — Alibaba_Qwen · 2026-09-20
- 开发者因 ComfyUI 在 Mac 上太慢,自建 Apple Silicon 本地模型启动器 — janishar · 2026-09-20
- 用 ARM SVE2 指令加速 JSON 解析,simd 已合入实测 — lemire · 2026-09-20