专题 · FULL STORY
Uno:离散扩散为LLM无损提速
arXiv 论文率先提出 Uno 方法,以离散扩散应对自回归 LLM 逐 token 生成的推理瓶颈;随后 IFM AI 团队正式发布扩散增强 LLM「Uno」,宣称实现无损 2.2 倍推理提速,事件由研究走向落地。
2026-09-08 ~ 2026-09-18 · 2 集 · 6 条
第 1 集 · 论文提出 Uno:离散扩散为 LLM 带来无损推理加速(2026-09-08,4 条)
arXiv 论文《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》提出 Uno 方法:保留原自回归模型保证质量,用 LoRA 蒸馏的轻量 diffusion adapter 结合 Ψ-Spec 采样并行起草多个 token,再由原模型验证,不改变输出分布。在 Qwen3-8B 上单请求吞吐提升 2.5 倍,可缓解长轨迹与并发 agent 负载下的延迟与成本问题。作者还回应了与 Orthrus 工作撞车的质疑。
- Uno 扩散增强 LLM:LoRA 蒸馏+Ψ-Spec 采样实现无损并行生成 — burkov · 2026-09-08
- Uno 用扩散并行起草提速 Qwen3-8B,单请求吞吐提升 2.5 倍 — rohanpaul_ai · 2026-09-09
- arXiv 论文详解 Uno:扩散蒸馏为 LLM 带来无损推理加速 — rohanpaul_ai · 2026-09-09
- 新论文用离散扩散为 LLM 提速,作者回应与 Orthrus 撞车质疑 — _akhaliq · 2026-09-09
第 2 集 · IFM AI 发布扩散增强 LLM「Uno」无损提速 2.2 倍(2026-09-18,2 条)
IFM AI 团队发布扩散增强 LLM「Uno」,针对自回归模型逐 token 顺序生成的推理瓶颈。其核心思路是将模型参数解耦为两组,分别用标准 NTP 目标训练,在 K2 基座上实现 2.2 倍加速。团队声称该方法无损,即以扩散模型的速度达到自回归模型的质量,不降低响应质量。
- 扩散增强 LLM「Uno」实现无损 2.2 倍加速,打破逐 token 生成瓶颈 — HongyiWang10 · 2026-09-18
- IFM AI 发布 Uno:扩散增强 LLM 无损提速 2.2 倍 — srchvrs · 2026-09-18