扩散增强 LLM「Uno」实现无损 2.2 倍加速,打破逐 token 生成瓶颈
HongyiWang10 · x · 2026-09-18
IFMAI 团队发布 Uno,一种扩散增强的 LLM,旨在解决自回归模型逐 token 顺序生成带来的推理瓶颈。
核心思路:
- 将模型参数解耦为两组:标准 NTP 目标训练的 AR 权重,加上轻量级扩散权重,用于并行一次抽取多个 token
- 扩散权重通过一个简单的 Diffusion Distillation 阶段学习,对现有训练管线几乎零额外开销
- 提出 Ψ-Spec 采样器家族,在固定上下文长度下实现无损加速与推理时扩展;无需 draft model(不同于投机解码),也不牺牲 AR 模型质量(不同于扩散 LLM)
结果:Uno 可从头训练或在现有开源 AR LLM 上增补构建;K2-Horizon-7B 在质量与吞吐上均超过 SOTA 扩散方法,最高 2.2 倍加速且无损;各 batch size 下吞吐均高于主流投机解码方法。论文已上 arXiv(2609.04010),模型已开放。
「研究」频道最新
- Liquid AI 推出长寿专业小模型,Cell 封面宣称胜过 GPT-5 等旗舰 — JosephJacks_ · 2026-09-18
- OpenAI 并未「解决」Navier–Stokes 方程,流体力学难题仍在 — gerardsans · 2026-09-18
- SPLADE 原作者发布新稀疏嵌入模型,150M 参数即超越 1B 级模型 — IgorCarron · 2026-09-18
- Gumroad 创始人公开个人骨肉瘤全套基因组与影像数据助力癌症研究 — iskander · 2026-09-18
- PointZero 世界模型不经机器人数据预训练,多项 3D 动力学任务 SOTA — YunzhuLiYZ · 2026-09-18
- 中国团队开源 Cache-to-Cache:LLM 免文字直接语义通信 — Scobleizer · 2026-09-18