阿里开源 Qwen-Image-2.1:仅 7B 参数,原生支持透明图输出
thione · x · 2026-09-28
阿里巴巴 Qwen 团队发布开源权重图像生成与编辑模型 Qwen-Image-2.1,视觉生成组件仅 70 亿参数,官方称在其自家基准上超过多数闭源模型(独立评测尚未出炉),可在 RTX 3090 等消费级 GPU 上运行。
关键能力:
- 原生生成与编辑透明图像(RGBA),可抠出物体或在透明图层上改文字
- 最多同时处理 10 张参考图,支持群像合成、虚拟试衣、房间设计
- 通过圆圈、蒙版或手绘标记引导局部编辑
- 架构改动与 KV cache 复用加速推理,多参考图场景尤其明显
模型已在 Hugging Face、GitHub 和 Model Scope 上架,并配有 Hugging Face demo。注意其研究许可禁止商用,商业用户需向 Qwen 单独申请许可。
「多模态」频道最新
- Photoshop Beta 推出独立 Relight 图层,可随意布光调色 — rufusd · 2026-09-28
- Opus 5.5 竟可一键生成 MV,自建管线开发者直呼被超越 — nptacek · 2026-09-28
- 可灵 4.0 官宣 10 月发布,Flash 版已对 Ultra 年费用户开放 — koltregaskes · 2026-09-28
- 博主抢先实测 Kling 4.0 Flash:提示词理解力惊人 — umesh_ai · 2026-09-28
- Opus 5.5 生成讲解视频,KP 重制 WebMCP 入门指南 — thisiskp_ · 2026-09-28
- AI 动效设计短板:音乐同步与音效生成仍不达标 — ciguleva · 2026-09-28