离散扩散并行采样加速 LLM 推理,无需草稿模型且无损
IFM · hf · 2026-09-08
IFM 在 Hugging Face 发布「Diffusion-augmented autoregressive language models」相关研究,提出用离散扩散权重蒸馏 + 专用采样器实现并行 token 采样,从而加速自回归 LLM 推理。
- 核心思路:在自回归骨架上叠加扩散式并行预测,多个 token 同时生成,摆脱逐 token 串行解码。
- 卖点:无损质量(不像投机采样那样有接受率损耗),且不需要 draft model,部署更简单。
- 宣称可获得 lossless 的推理加速,对推理服务成本与延迟优化有直接意义。
「Infra」频道最新
- 凌晨想法:能否用分布式 iPhone 组成推理网络? — gajesh · 2026-09-08
- 候选深度 10→500 分数仅涨 0.01:Qdrant 实测检索调参先诊断再动手 — qdrant_engine · 2026-09-08
- Reddit 网友为 7900XTX 定制 llama.cpp:27B Q8 跑出 1600tk/s 预填充 — nasone32 · 2026-09-08
- 同一模型 token 消耗差 9.2 倍:编程框架比模型更影响成本 — zainhas · 2026-09-08
- 日本推出 JapanFold:8 个开源生物学 AI 模型免费供国内研究者使用 — DavidBennett__ · 2026-09-08
- M4 MacBook Air 已吃力:开发者用 Codex 跑本地 MLX 模型生成音乐 — Dimillian · 2026-09-08