arXiv 论文详解 Uno:扩散蒸馏为 LLM 带来无损推理加速
rohanpaul_ai · x · 2026-09-09
arXiv 论文《Unlocking Lossless Speedups in LLMs via Discrete Diffusion》提出 diffusion-augmented LLM(Uno):将模型参数解耦为标准的 AR 权重(NTP 训练)和轻量 diffusion 权重(通过 Diffusion Distillation 阶段学习,对现有训练流程开销可忽略),后者可同时生成多个 token。
- 引入 Ψ-Spec 采样器家族,实现无损加速与固定上下文长度下的推理时 scaling
- 与投机解码不同,无需单独 draft 模型;与 diffusion LLM 不同,不牺牲底层 AR 模型的质量
- 可从零训练,也可在现有开源权重 AR LLM 上加装;在每个评测 batch size 下吞吐都超过主流投机解码方法
- 作者团队含 Eric Xing、Zhengzhong Liu、Joel Hestness 等
所属事件:Uno 用离散扩散为 LLM 实现无损推理加速(3 条相关)→
「Infra」频道最新
- fal「H3 Max Director」解析:可中途改 prompt 的流式视频生成 — noahsolomon · 2026-09-09
- SpaceX 收购燃气轮机业务,为明年扩到 10GW 算力铺路 — DMaguireARK · 2026-09-09
- vLLM 推出 Hybrid HiSparse:KV 溢出 GPU 也能继续解码,1M 上下文并发翻两番 — vllm_project · 2026-09-09
- 一周烧掉 2250 万美元算力,数学突破有了新价格标签 — vykthur · 2026-09-09
- 100 万美元听着多,只够 OpenAI 算力开销 10.5 分钟 — wordgrammer · 2026-09-09
- SageMaker Feature Store 推出 UpdateRecord,单次调用实现特征级写入 — AWS ML Blog · 2026-09-09