Qwen-Image-2.1 模型卡详解:混合粒度注意力与 KV 缓存复用

AdinaYakup · x · 2026-09-21

Hugging Face 上的 Qwen-Image-2.1 模型卡给出了更多技术细节:模型以 7B 参数(32 层 Single-Stream DiT)平衡生成质量与推理效率,采用混合粒度注意力与前缀 KV 缓存复用降低计算成本;统一支持文生图与编辑,可生成 RGBA 透明图、编辑透明图层、抠出照片主体;编辑时支持最多 10 张参考图,可用圆圈、涂抹标注或独立 mask 指定局部修改,并保持人物与产品身份;排版、人像光效与细节纹理也有提升。模型卡附 pip 安装与 Diffusers QwenImage21Pipeline 快速上手代码,许可证为 qwen-research(仅限研究与评估)。

所属事件:阿里开源 Qwen-Image-2.1:7B 模型统一图像生成与编辑(34 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →