离散扩散新方法让 LLM 推理无损提速,可直接替换现有训练管线
Cohere · youtube · 2026-10-03
这是 Cohere Labs 对话系列的讲座,由 MBZUAI-IFM 高级研究科学家 Subham Sahoo 主讲,主题为「通过离散扩散实现 LLM 的无损加速」。
- 自回归模型生成质量高,但串行解码导致推理慢;扩散语言模型可通过并行生成大幅提速,但 Mercury2、Diffusion Gemma、Nemotron Diffusion 等现有系统在质量上仍落后于前沿自回归模型。
- 讲座提出一种离散扩散方法,可证明地实现无损推理加速:作为现有训练管线的 drop-in 替换,不损失模型质量,并在各级推理并行度下显著提升吞吐。
- 实验显示该方法在质量上优于现有扩散基线,同时比自回归解码快得多。
「Infra」频道最新
- Prime Intellect 推出自有推理栈 Prime Inference,已服务万亿 token — xeophon · 2026-10-03
- Sam Altman 证实 OpenAI 与 Cerebras 深度合作,共推推理速度前沿 — sama · 2026-10-03
- CUDA 护城河松动:DeepSeek 让昇腾可用,摩尔线程做 CUDA→MUSA 转译 — teortaxesTex · 2026-10-03
- Epoch AI:现有芯片可同时跑 19 亿个智能体,相当于全人类工时 — 141_1337 · 2026-10-03
- 骁龙 8 Elite Gen 6 发布:首款 5GHz 手机 CPU,端侧可跑 300 亿参数 MoE — DavidLinthicum · 2026-10-03
- DFlash2 投机解码提速 2.8 倍,Qwen3.8 三个本地版本实测横评 — FantasticNature7590 · 2026-10-03