阿里开源 Qwen-Image-2.1:7B 生图登顶开源第一,原生透明图
机器之心 · wechat · 2026-09-20
阿里千问开源图片生成模型 Qwen-Image-2.1,主打文生图与图像编辑一体化,面向真实设计工作流。
- 成绩:Qwen-Image-Bench 总分 60.28,超 NanoBanana2.0(59.82)与 GPT Image 1.5(59.65),居开源模型第一,而视觉生成部分仅 7B 参数,采用 20 层 Single-Stream DiT,原生支持 2K。
- 关键能力:原生透明图(RGBA)生成与从照片提取透明主体;最高 10 张参考图的多图编辑,支持圈选、涂抹、独立掩码做局部修改;强化人像身份与商品包装文字/纹理保真;文字渲染与排版更准;新增全景图、信息图、三视图、分镜能力。
- 效率优化:混合粒度注意力——文本走 token 级因果掩码,图像走 chunk 级掩码并用 KVCache 缓存参考图与指令等静态上下文,多图输入时显著降显存、提推理效率。
- 权重已发布于 Hugging Face 与 ModelScope,技术报告在 GitHub。需注意其许可证为严格的 qwen-research 非商用许可,无营收上限豁免。
所属事件:阿里开源 Qwen-Image-2.1:7B 统一生图与编辑(20 条相关)→
「多模态」频道最新
- Qwen-Image 2.1 实测:30.8GB 本地跑,透明与文字处理出色 — DevDminGod · 2026-09-20
- 网友用 AI 生成墓碑,石刻纹理与光影效果惊艳 — floguo · 2026-09-20
- TischLog #46 发布:专为 Midjourney V8.2 打造的赛博朋克风格包 — tisch_eins · 2026-09-20
- 用户实测:Yue2 bf16 量化版节奏崩坏,int8 反而更稳 — Inevitable_Pen9043 · 2026-09-20
- Grok 生图 + Veo 生视频 + Topaz 放大:古希腊方阵创作流水线 — creatoroff · 2026-09-20
- ComfyUI 单文件版 Qwen-Image-2.1 登上 Hugging Face 热门 — Comfy-Org · 2026-09-20