vLLm 出现扩散模型结构化生成 PR,DiffusionGemma 可受控输出
victormustar · x · 2026-09-21
开发者 mmastrac 向 vLLM 提交了一个核心 PR(#57250),为扩散式语言模型 DiffusionGemma 增加「结构化生成模式」(标注为 Jev-like),使其能像自回归模型一样输出符合结构的文本,共 15 个提交。
- 附带多个前置 PR:bug 修复(仅在提交步骤输出暂存 logprobs)、性能优化(prefill-only batch 的 logit 行数)、以及收敛步骤对 logprobtokenids 的支持(与自回归模式功能对齐)
- 若合入,意味着在 vLLM 推理栈上可以同时获得扩散 LLM 的并行解码速度与结构化输出的可控性,是扩散语言模型走向实用部署的一步
「Infra」频道最新
- Mozilla 实测:本地 30B 模型零 API 全程自动开出真实 PR — mozilla-ai · 2026-09-21
- Cohere Labs 推出 Local AI 社区计划,聚焦本地推理与硬件调优 — Cohere_Labs · 2026-09-21
- Gewell:利用 Gemma 4 结构,KV 缓存省 37.5% 显存的推理引擎 — stoppableDissolution · 2026-09-21
- DeepSeek-V4.1-Flash 重构架构:KV 缓存压缩至每 token 890 字节 — AndLukyane · 2026-09-21
- Jev Engineering:给 Agent 加决策大脑,测试提速193倍降本444倍 — agihouse_org · 2026-09-21
- 英国最强 AI 超算 Isambard-AI 造价 2.25 亿英镑,约等于一座桥 — charlieharris01 · 2026-09-21