阿里开源 Qwen-Image-2.1:7B 统一生图与改图,支持透明图层
Xianbao_QIAN · x · 2026-09-20
阿里 Qwen 团队开源 Qwen-Image-2.1,一个统一文生图与图像编辑的模型,视觉生成部分仅 7B 参数(32 层 Single-Stream DiT),采用 qwen-research 许可,已支持 vLLM-Omni 与 Diffusers。
四大改进:
- 轻量高效:混合粒度注意力 + prefix KV cache 复用,低成本保持画质
- 原生透明度:可直接生成/编辑 RGBA 透明图层,并从照片中抠取主体
- 灵活编辑:支持最多 10 张参考图,可用圆圈、涂鸦标注或蒙版指定局部编辑,保持人物与产品身份一致
- 质感提升:排版、人像打光与细节更精致
模型已在 Hugging Face、ModelScope 上线,可用 diffusers 的 QwenImage21Pipeline 快速上手(bfloat16、2048×2048 直出)。
所属事件:阿里开源 Qwen-Image-2.1:7B 统一生图与编辑,原生透明图(18 条相关)→
「多模态」频道最新
- Jev 稀疏注意力提速 MiniMax H3 视频生成,RTX 4070 耗时缩短 41.7% — TheMoonMidas · 2026-09-20
- 一张角色设定图加 MiniMax H3,静态游戏角色秒变活灵活现 — azed_ai · 2026-09-20
- Qwen Image 2.1 图像修复实测翻车:对比度漂移、颗粒感变合成噪点 — y3kdhmbdb2ch2fc6vpm2 · 2026-09-20
- 用 Codex Astra 接 Hyper3D Rodin MCP,一句指令造出可点击 3D 原型 — alex_verem · 2026-09-20
- NoSpoon 自主 agent 生成微短剧,连开发者都被剧情吊住 — Kyrannio · 2026-09-20
- 网友用 AI 生成 10 张 SCP-096 惊悚图像,还想拍短片 — VraserX · 2026-09-20