Uno Uses Discrete Diffusion for Lossless LLM Speedups
The Uno paper adds a LoRA-distilled diffusion adapter to draft tokens in parallel while the original autoregressive model verifies, delivering lossless 2.5x throughput gains on Qwen3-8B.
2026-09-08 ~ 2026-09-09 · 3 related posts
- Uno: Diffusion-Augmented LLM Uses LoRA Drafts and Ψ-Spec Sampler for Lossless Speedups — burkov · 2026-09-08
- Uno speeds up Qwen3-8B 2.5x by using diffusion for parallel token drafting — rohanpaul_ai · 2026-09-09
- Uno paper: discrete diffusion drafting gives lossless LLM speedups without a draft model — rohanpaul_ai · 2026-09-09