vLLM 出现 DiffusionGemma 结构化生成 PR,单机 DGX Spark 延迟亮眼
generativist · x · 2026-09-17
开发者 mmastrac 向 vLLM 提交早期 PR(#57250),为 DiffusionGemma 模型添加类 Jev 的结构化生成模式。
- 思路:利用 DiffusionGemma 已有组件,在给定结构化输出格式中固定 canvas 位置,让模型输出 token 及 logprobs,客户端由熵推断模型最可能的答案与置信度;熵超过阈值时可追加采样提升置信。
- 延迟表现:作者称在单台 DGX Spark 上用开源模型跑出的延迟,仅为官方发布端点的约 2 倍,相当可观。
- 当前限制:需要在 vLLM 与客户端之间加一层 structured-response 服务,作者计划把该层并入 PR 本身。
「Infra」频道最新
- llama.cpp 加载 Qwen3.8 MTP 草稿模型报错,tensor 缺失无解 — Ambitious_Fold_2874 · 2026-09-17
- 预测:18个月内Kimi K3级智能将跑在单张RTX 5090上 — TheZachMueller · 2026-09-17
- 有用户称愿为 AI 订阅月付 1000 美元,但定价过高会推向本地部署 — draginol · 2026-09-17
- 腾讯开源 FlexKV 分布式 KV 缓存:TTFT 最高降 70%,吞吐提升 16% — Roger_M_Taylor · 2026-09-17
- NVIDIA 上架 DeepSeek-V4.1-Flash NVFP4 量化版,MIT 协议开源 — TheZachMueller · 2026-09-17
- Bittensor 挖矿优化被 vLLM 收编,Qwen3 吞吐提升约 4% — const_reborn · 2026-09-17