Qwen-Image 2.1 合入 diffusers,官方称其为家族中性价比最高模型
linoy_tsaban · x · 2026-09-18
Qwen-Image 2.1 已正式合入 Hugging Face diffusers(PR #14804),是一个统一支持文生图与图生图的模型,官方称其为 Qwen-Image 家族中「最均衡、单位算力价值最高」的一代。技术要点:
- Transformer:QwenImage21Transformer2DModel,单流结构,采用块因果注意力(block-causal attention),对文本与条件图前缀做 t=0 调制,并支持 KV cache
- VAE:AutoencoderKLQwenImage21,64 通道(zdim=64),decoderbasedim=144
- Pipeline:QwenImage21Pipeline 同时支持 text-to-image 与图像条件生成
该模型以开源形式发布,diffusers 用户现已可以直接使用。
「多模态」频道最新
- 何同学 iPhone 18 Pro 评测动画背后:AI 融入动效制作流程 — tinyfool · 2026-09-18
- Seedance 2.5 生成日式教室丧尸围城短片,作者附完整提示词 — umesh_ai · 2026-09-18
- TripoAI P2.0 公测:Smart UV 约 5-7 秒完成低模展开与干净接缝 — majidmanzarpour · 2026-09-18
- 作者实测用 GPT-6 Astra 导演动效工作室,沉淀五步工作流 — PrajwalTomar_ · 2026-09-18
- 博主评 Midjourney:各家死磕提示词遵循,它的创造性依然无可替代 — umesh_ai · 2026-09-18
- FastVideo 发布 FastH3-8-Step-V2:MiniMax-H3 蒸馏版 8 步出视频 — solyarisoftware · 2026-09-18