Flash-dLLM:扩散式 LLM 推理提速最高 11 倍

MBZUAI · hf · 2026-09-23

MBZUAI 提出免训练的扩散式大语言模型(dLLM)推理加速框架 Flash-dLLM。核心发现是 KV cache 场景下 GPU 内存 I/O 是主要瓶颈,为此设计了 I/O 感知的融合 KV-cache kernel,减少冗余内存搬运;在此基础上提出以 KV cache 驱动的 draft-and-verify 并行解码策略,dLLM 自身同时充当 drafter 和 verifier,无需辅助模型。该方法保持生成质量的同时提升长序列与大批量的可扩展性。在数学推理与代码生成基准上,GSM8K 相对最强基线 Elastic-Cache 提速 5.1 倍,HumanEval 提速 11.0 倍。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →