Qwen-Image-2.1 model card: mixed-granularity attention, prefix KV reuse, quickstart code

AdinaYakup · x · 2026-09-21

The Hugging Face model card details Qwen-Image-2.1: a 7B-parameter (32-layer Single-Stream DiT) model using mixed-granularity attention and prefix KV cache reuse for low-cost inference. It unifies generation and editing — RGBA transparent image generation, editing transparent layers, subject extraction — supports up to 10 reference images with identity preservation, and enables local edits via circles, painted annotations or separate masks. Typography, portrait lighting and fine textures are improved. The card ships pip install instructions and a Diffusers QwenImage21Pipeline quickstart; the license is research-and-evaluation-only.

Related event: Alibaba Open-Sources Qwen-Image-2.1: A Unified 7B Text-to-Image and Editing Model(34 posts)→

Original post →

More from Multimodal

Multimodal channel →