Qwen 开源 Qwen-Image-2.1:7B 文生图+编辑,支持 RGBA 透明图与 10 张参考图
multimodalart · x · 2026-09-20
阿里 Qwen 团队开源统一文生图与图像编辑模型 Qwen-Image-2.1,视觉生成组件仅 7B 参数(32 层 Single-Stream DiT),在质量、效率与通用性间取得平衡。
四大改进:
- 紧凑高效:混合粒度注意力 + prefix KV cache 复用,低算力下保持画质
- 原生透明图:可直接生成/编辑 RGBA 透明图层、从照片抠主体
- 多样编辑:支持最多 10 张参考图,可通过圆圈、涂画标注或 mask 指定局部编辑,保留人物与产品身份
- 真实质感:改进排版、人像打光与细节
已上架 Diffusers(QwenImage21Pipeline),支持 2048×2048 分辨率生成,采用 qwen-research 许可证,附 HuggingFace/ModelSpace Demo 与博客。
所属事件:阿里开源 Qwen-Image-2.1:7B 统一生图与编辑,原生透明图(18 条相关)→
「多模态」频道最新
- Jev 稀疏注意力提速 MiniMax H3 视频生成,RTX 4070 耗时缩短 41.7% — TheMoonMidas · 2026-09-20
- 一张角色设定图加 MiniMax H3,静态游戏角色秒变活灵活现 — azed_ai · 2026-09-20
- Qwen Image 2.1 图像修复实测翻车:对比度漂移、颗粒感变合成噪点 — y3kdhmbdb2ch2fc6vpm2 · 2026-09-20
- 用 Codex Astra 接 Hyper3D Rodin MCP,一句指令造出可点击 3D 原型 — alex_verem · 2026-09-20
- NoSpoon 自主 agent 生成微短剧,连开发者都被剧情吊住 — Kyrannio · 2026-09-20
- 网友用 AI 生成 10 张 SCP-096 惊悚图像,还想拍短片 — VraserX · 2026-09-20