Uno 用扩散并行起草提速 Qwen3-8B,单请求吞吐提升 2.5 倍

rohanpaul_ai · x · 2026-09-09

Uno 提出一种不改变输出分布即可加速现有 LLM 的方法:保留原自回归模型负责质量,只用轻量 diffusion adapter 并行起草多个 token,再由原模型验证,因此无需单独的 draft 模型,也保持基础模型的采样行为。

在 Qwen3-8B 上,Uno 在最大测试 batch size 下实现单请求吞吐提升 2.5 倍、系统吞吐提升 1.6 倍,端到端 RL 训练最高提速 40%。

所属事件:Uno 用离散扩散为 LLM 实现无损推理加速(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →