专题 · FULL STORY

Uno:离散扩散为LLM无损提速

arXiv 论文率先提出 Uno 方法,以离散扩散应对自回归 LLM 逐 token 生成的推理瓶颈;随后 IFM AI 团队正式发布扩散增强 LLM「Uno」,宣称实现无损 2.2 倍推理提速,事件由研究走向落地。

2026-09-08 ~ 2026-09-18 · 2 集 · 6 条

第 1 集 · 论文提出 Uno:离散扩散为 LLM 带来无损推理加速(2026-09-08,4 条)

arXiv 论文《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》提出 Uno 方法:保留原自回归模型保证质量,用 LoRA 蒸馏的轻量 diffusion adapter 结合 Ψ-Spec 采样并行起草多个 token,再由原模型验证,不改变输出分布。在 Qwen3-8B 上单请求吞吐提升 2.5 倍,可缓解长轨迹与并发 agent 负载下的延迟与成本问题。作者还回应了与 Orthrus 工作撞车的质疑。

第 2 集 · IFM AI 发布扩散增强 LLM「Uno」无损提速 2.2 倍(2026-09-18,2 条)

IFM AI 团队发布扩散增强 LLM「Uno」,针对自回归模型逐 token 顺序生成的推理瓶颈。其核心思路是将模型参数解耦为两组,分别用标准 NTP 目标训练,在 K2 基座上实现 2.2 倍加速。团队声称该方法无损,即以扩散模型的速度达到自回归模型的质量,不降低响应质量。