vLLM 首日支持 Qwen-Image-2.1:KV cache 复用加速推理,附部署指南
Alibaba_Qwen · x · 2026-09-20
vLLM 项目宣布对 Qwen-Image-2.1 提供首日(day-0)支持,Qwen 官方转发致谢。技术上,Qwen-Image-2.1 是 7.1B 单流 DiT(块因果注意力)搭配 Qwen3-VL-8B 文本编码器和 16x RGBA 自编码器,一个模型同时服务文生图与图像编辑。
vLLM-Omni 的优化要点:
- 跨步前缀 KV cache 复用:把文本与参考图部分的编码变成一次性成本,而非每步重复计算
- 专用 CUDA Graphs、请求级与步级连续批处理、phase-aware 调度
- 支持 tensor/Ulysses 序列并行、分布式 VAE 解码(含 OOM 恢复)、FP8 权重、CPU offload
一个 QwenImage21Pipeline 即可同时跑生成与编辑,无需单独加载编辑模型。官方配方给出采样默认值:40 步、cfg-scale 设 1.0(仅配负向提示词时才有效)。
「Infra」频道最新
- GPT Luna 意外胜任个人助理,本地小模型跑 Agent 到底值不值? — gized00 · 2026-09-20
- OpenAI 硬件 VP 详述首颗自研芯片 Jalapeño:9 个月流片 — bigdata · 2026-09-20
- llama.cpp 分支实现 Declarative Attention,解码耗时降到 0.71× — Ok-Shower7286 · 2026-09-20
- Vulkan 本地训练器 VTrain 修复内存泄漏,更多负载转移至 GPU — Savantskie1 · 2026-09-20
- 开发者因 ComfyUI 在 Mac 上太慢,自建 Apple Silicon 本地模型启动器 — janishar · 2026-09-20
- vLLM-Omni 发布:KV 复用、FP8 等多项优化加速全模态推理 — vllm_project · 2026-09-20