阿里发布 Qwen-Image-3.0,主打密集排版与多语种文字渲染

7 月 21 日,阿里千问团队正式发布新一代图像生成模型 Qwen-Image-3.0。本代模型的核心主线被官方概括为“实”,旨在让图像生成更贴近真实世界中的可用场景,能够容纳更复杂的内容并理解现实世界的界面与语言,将图像生成推进到“可生产”层面。

关键细节与能力

Qwen-Image-3.0 大幅提升了提示词的容纳上限,支持最长 4.5k token 的输入。这使得模型能够一次性生成信息图、报纸、试卷、复杂分镜以及嵌套界面等高信息密度的复杂版式画面。在文字处理方面,该模型强化了文字渲染能力,最小可做到 10px 级别的小字渲染,并支持包括日语、韩语、西班牙语等在内的 12 种多语言渲染。此外,@Linkpharm2 指出该模型还支持图像编辑,并能在一次调用中产出多张图片。

各方反应

根据 @bdsqlsz 分享的生成结果,该模型在人物肖像、刺绣风格图像以及厚涂绘画笔触等细节多模态生成上也有出色表现。Reddit 上的讨论也对其完全生成的效果图表示认可,认为这次更新“可能真有东西”。

2026-07-21 ~ 2026-07-21 · 11 条相关

另有 4 条近重复转述:koltregaskes · airesearch12 · 智东西 · matchaman11