Uno 扩散增强 LLM:LoRA 蒸馏+Ψ-Spec 采样实现无损并行生成

burkov · x · 2026-09-08

这篇论文针对 LLM 核心低效问题:next-token 预测生成质量高但只能串行生成,浪费加速器算力,推高延迟与训练成本,在长轨迹和并发 agent 负载下尤其严重。

核心方法:提出扩散增强 LLM「Uno」,保留完整自回归权重(标准 next-token 训练),另加轻量 LoRA 适配器,经短暂的 Diffusion Distillation 阶段训练,用于并行提出 token 块。

推理时:新的 Ψ-Spec 采样器从扩散路径并行起草,再用冻结的自回归分布验证,目标是实现无损加速——在保持强自回归模型精确输出分布的前提下,每步生成多个 token。

所属事件:Uno 用离散扩散为 LLM 实现无损推理加速(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →