专题 · FULL STORY

阿里Qwen-Image-3.0:从发布到实测

阿里千问团队发布第三代图像生成模型,主打复杂排版与多语言渲染。随后多方实测印证其核心优势,确认该模型在中文长文本及多语版式等实用生成任务中表现优异。

2026-07-21 ~ 2026-07-23 · 2 集 · 20 条

第 1 集 · 阿里发布 Qwen-Image-3.0,主打复杂排版与多语言渲染(2026-07-21,17 条)

7 月 21 日,阿里千问团队正式发布第三代基础图像生成模型 Qwen-Image-3.0。本代模型的核心主线被官方概括为一个字:“实”,旨在让图像生成更贴近真实世界中的可用场景,将图像生成推进到“可生产”层面。

关键细节与能力

Qwen-Image-3.0 大幅提升了提示词的容纳上限,支持最长 4.5K token 的输入。这使得模型能够一次性生成信息图、报纸、试卷、复杂分镜以及嵌套界面等高信息密度的复杂版式画面。官方曾演示使用 3.7K token 的提示词生成 3×3 复杂信息图,一条约 3000 字的长指令即可生成 9 张信息图或整版报纸。此外,官方还演示了深度嵌套能力,能用一个提示词从外到内生成包含 VS Code、Qwen Chat、聊天应用及手冲咖啡海报等四层结构的 UI 画面。在文字处理方面,该模型强化了文字渲染能力,最小可做到 10px 级别的小字渲染,并支持包括日语、韩语、西班牙语等在内的 12 种多语言原生渲染。据 @Linkpharm2 指出,该模型还支持图像编辑,并能在一次调用中产出多张图片,覆盖 100+ 艺术风格。此外,@mark_k 的测试帖文表明该模型在处理画面中的文字、光照和反射等复杂细节上也进行了重点优化。

各方反应

根据 @bdsqlsz 分享的生成结果,该模型在人物肖像、刺绣风格图像以及厚涂绘画笔触等细节多模态生成上表现出色。Reddit 上的讨论也对其完全生成的效果图表示认可,认为这次更新“可能真有东西”。

第 2 集 · 阿里 Qwen-Image-3.0 实测:主打实用生成与排版(2026-07-22,3 条)

近期多方实测表明,阿里 Qwen-Image-3.0 的核心优势在于实用性生成。该模型在中文长文本、双语及六语排版等复杂版式任务中表现优异,并能进行精细改图。与 GPT-Image-2 的对比测试显示,它将图像生成向“能干活”推进了一步,但实际应用中仍需一定的提示词适配。