阿里发布 Qwen-Image-3.0,主打密集排版与多语种文字渲染
7 月 21 日,阿里千问团队正式发布新一代图像生成模型 Qwen-Image-3.0。本代模型的核心主线被官方概括为“实”,旨在让图像生成更贴近真实世界中的可用场景,能够容纳更复杂的内容并理解现实世界的界面与语言,将图像生成推进到“可生产”层面。
关键细节与能力
Qwen-Image-3.0 大幅提升了提示词的容纳上限,支持最长 4.5k token 的输入。这使得模型能够一次性生成信息图、报纸、试卷、复杂分镜以及嵌套界面等高信息密度的复杂版式画面。在文字处理方面,该模型强化了文字渲染能力,最小可做到 10px 级别的小字渲染,并支持包括日语、韩语、西班牙语等在内的 12 种多语言渲染。此外,@Linkpharm2 指出该模型还支持图像编辑,并能在一次调用中产出多张图片。
各方反应
根据 @bdsqlsz 分享的生成结果,该模型在人物肖像、刺绣风格图像以及厚涂绘画笔触等细节多模态生成上也有出色表现。Reddit 上的讨论也对其完全生成的效果图表示认可,认为这次更新“可能真有东西”。
2026-07-21 ~ 2026-07-21 · 11 条相关
- 【源头】阿里发布 Qwen-Image-3.0,支持 4.5k token 和 10px 小字 — 千问大模型 · 2026-07-21
- 阿里发布 Qwen-Image-3.0,支持 4.5k token 和 12 种语言渲染 — Scobleizer · 2026-07-21
- Qwen-Image-3.0 发布,支持 4.5k token 输入和更细文字渲染 — pony57163 · 2026-07-21
- 【源头】Qwen-Image3.0 公开,支持日韩西多语言渲染 — bdsqlsz · 2026-07-21
- Qwen Image 3.0 在 Reddit 曝出多张全生成效果图 — SpiritualWindow3855 · 2026-07-21
- 【源头】Qwen Image 3 支持编辑,还能一轮生成多张图 — Linkpharm2 · 2026-07-21
- Qwen-Image-3.0 主打更丰富细节的图像生成 — JeremyCMorgan · 2026-07-21
另有 4 条近重复转述:koltregaskes · airesearch12 · 智东西 · matchaman11