DiffusionGemma-Jev 合入 vLLM:一步去噪读出答案置信度
bodonoghue85 · x · 2026-09-23
vLLM 项目宣布 DiffusionGemma-Jev 现已支持结构化生成模式(由 mmastrac 主导的 PR #57250 已合入 main),专门面向 yes/no、选择题或打分类问题,每个答案都附带置信度。
技术做法:vLLM 先用响应模板铺好画布,只让答案槽位保持噪声,再在单步去噪中直接从每个槽位读出概率分布,无需自回归逐 token 生成。
配合 Google Gemma 官方发布的部署方案,用户可用一条命令在 Google Cloud Run 上拉起 Jev API 兼容端点:单步延迟约 35-60ms,batch@32 吞吐约 100-123 请求/秒;价格约 $3/小时,空闲时降至 $0,无需自有 GPU 即可实验。
「Infra」频道最新
- 四台 Mac Studio 雷电串联跑万亿参数模型,苹果力推 Mac 当本地 AI 机器 — mark_k · 2026-09-23
- 芯片设计初创 Archgen Labs 获 YC 投资目标提速千倍 — retr0jirachi · 2026-09-23
- 极客把 Omarchy 装进 PSP,还跑通 9000 万参数 LLM — Kyrannio · 2026-09-23
- 网友自组双 AMD R9700 本地推理机,征集调优经验 — Current-Ticket4214 · 2026-09-23
- 开源代理 stuntd:记录应用小决策并训练本地模型,90% 问题免费作答 — Inevitable-Log5414 · 2026-09-23
- OpenRouter 批量 API 覆盖 71 款模型,价格自动择优路由 — jeff_weinstein · 2026-09-23