Uno Uses Discrete Diffusion for Lossless LLM Speedups

The Uno paper adds a LoRA-distilled diffusion adapter to draft tokens in parallel while the original autoregressive model verifies, delivering lossless 2.5x throughput gains on Qwen3-8B.

2026-09-08 ~ 2026-09-09 · 3 related posts