借助「结构化决策」思路把 DiffusionGemma 推理提速 3-10 倍
bodonoghue85 · x · 2026-09-17
开发者 mmastrac 借鉴 Jev 的思路为 Google Gemma DiffusionGemma 实现了 3-10 倍推理加速,并已合入其 diffgemma 仓库(PR #21)。
核心做法:扩散模型本身就在操作概率分布——若把响应中的结构化 token 固定住,即可大幅减少前向计算量。具体实现是把一条 JSON 问题 schema 注入系统消息,使 /v1/chat/completions 请求变成一次「打分式去噪前向」:答案模板被种入 canvas,每个标签槽位作为噪声,直接从该槽位的 logits 读取标签分布。这样每个问题的成本固定为一次前向,且每个槽位能双向条件于整个模板,模式类似 TypeSafe 的 Jev API(choice/score/yes-no 问题附带概率与置信度)。作者认为该思路也可引入 vLLM。
「Infra」频道最新
- 开发者提议 Claude Code 应做预测性动态上下文缓存 — Sauers_ · 2026-09-17
- Starlink 拉美农村联网大扩张:洪都拉斯万台天线连 8000 所学校 — NicoVerderosa · 2026-09-17
- 一次大规模推理跑了多少钱?Fable 显示每秒烧掉 1050 美元 — Sauers_ · 2026-09-17
- 一次大规模推理跑每秒烧 1050 美元,作者直呼心疼 — Sauers_ · 2026-09-17
- Nebius 今年第二次上调 GPU/CPU 按需价格 — kevinsxu · 2026-09-17
- 某公司强化学习训练成本突破 100 万美元,业内称前所未见的透明度 — zainhas · 2026-09-17