incoai releases Qwen3.8-27B-DFlash2 draft model for speculative decoding

incoai · hf · 2026-08-20

incoai released Qwen3.8-27B-DFlash2, a block-diffusion based DFlash2 draft model for speculative decoding to speed up inference. It supports SGLang and vLLM and is trending on Hugging Face.

Related event: Qwen3.8-27B DFlash2 Draft Model Speeds Up Inference via Block-Diffusion(2 posts)→

Original post →

More from Models

Models channel →