vLLM 支持 Google DiffusionGemma:块扩散 MoE 吞吐约提升 1.9 倍
vllm_project · x · 2026-09-23
vLLM 官方宣布 nightly 版已支持 Google 的 DiffusionGemma-26B-A4B-it,并给出部署指南。
要点:
- 架构:基于 Gemma 4 MoE 骨干的块扩散语言模型,26B 总参 / 4B 激活,128 个细粒度专家、top-8 路由。
- 生成方式:不做自回归解码,而是在固定长度画布上按 256-token 块迭代去噪(每块最多 48 步),换取约 1.9 倍的单请求吞吐,代价是更高首 token 延迟。
- 其他能力:支持文本+图像多模态(Gemma 4 视觉编码器)、思考模式(<|channel>thought 分隔符)、函数调用。
- 部署注意:扩散状态缓冲区会按 maxseqs × canvaslength × vocabsize 预分配显存,262K 词表下必须用 --max-num-seqs 4 等特殊参数,否则 OOM;生成配置需用 --generation-config vllm。
部署命令:vllm/vllm-openai:nightly,vLLM ≥0.24.0。
「Infra」频道最新
- 网友自组双 AMD R9700 本地推理机,征集调优经验 — Current-Ticket4214 · 2026-09-23
- OpenRouter 批量 API 覆盖 71 款模型,价格自动择优路由 — jeff_weinstein · 2026-09-23
- 工程师求全离线文档问答方案:Ollama+Open WebUI+RAG 组合获荐 — betobagio · 2026-09-23
- 评论者批 Googlebook 硬件无野心:Intel NPU 放弃消费级市场 — julianharris · 2026-09-23
- Kimi K3 等开源大模型或严重欠训练,数据 scaling 远未见顶 — zeeshanp_ · 2026-09-23
- 从业者泼冷水:约三分之二场景 LLM 推理提速并不惊艳,全靠投机解码撑门面 — teortaxesTex · 2026-09-23