DiffusionGemma-Jev 合入 vLLM:一步去噪读出答案置信度

bodonoghue85 · x · 2026-09-23

vLLM 项目宣布 DiffusionGemma-Jev 现已支持结构化生成模式(由 mmastrac 主导的 PR #57250 已合入 main),专门面向 yes/no、选择题或打分类问题,每个答案都附带置信度。

技术做法:vLLM 先用响应模板铺好画布,只让答案槽位保持噪声,再在单步去噪中直接从每个槽位读出概率分布,无需自回归逐 token 生成。

配合 Google Gemma 官方发布的部署方案,用户可用一条命令在 Google Cloud Run 上拉起 Jev API 兼容端点:单步延迟约 35-60ms,batch@32 吞吐约 100-123 请求/秒;价格约 $3/小时,空闲时降至 $0,无需自有 GPU 即可实验。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →