Flash-dLLM:扩散式 LLM 推理提速最高 11 倍
MBZUAI · hf · 2026-09-23
MBZUAI 提出免训练的扩散式大语言模型(dLLM)推理加速框架 Flash-dLLM。核心发现是 KV cache 场景下 GPU 内存 I/O 是主要瓶颈,为此设计了 I/O 感知的融合 KV-cache kernel,减少冗余内存搬运;在此基础上提出以 KV cache 驱动的 draft-and-verify 并行解码策略,dLLM 自身同时充当 drafter 和 verifier,无需辅助模型。该方法保持生成质量的同时提升长序列与大批量的可扩展性。在数学推理与代码生成基准上,GSM8K 相对最强基线 Elastic-Cache 提速 5.1 倍,HumanEval 提速 11.0 倍。
「Infra」频道最新
- 曝 Anthropic 洽租阿波罗系数据中心至多 1GW 算力 — rohanpaul_ai · 2026-09-23
- 曝 Anthropic 拟向 Apollo 旗下数据中心租赁最多 1GW 算力 — rohanpaul_ai · 2026-09-23
- 推理服务创业实测:能持续改进模型的训练能力才能留住客户 — ypatil125 · 2026-09-23
- M6 芯片 ANE 内存带宽超 150GB/s,可媲美 GPU/CPU — AIFlow_ML · 2026-09-23
- 报道称 Anthropic 谈判锁定更多数据中心算力 — pstAsiatech · 2026-09-23
- 网友算账:MiMo 论文 127 万条 rollout 轨迹,或只需 10 小时算力 — teortaxesTex · 2026-09-23