阿里发布 Qwen-Image-3.0,支持 4.5K 提示词和 10px 小字
airesearch12 · x · 2026-07-21
阿里这次放出的 Qwen-Image-3.0,重点明显放在 文字排版和复杂版面 能力上。
- 官方说它支持最长 4.5K tokens 的提示词。
- 还能生成小到 10px 仍可读的文字。
- 支持 12 种语言,以及 100+ 种视觉风格。
- 演示里包括整版报纸、试卷、界面,以及一次性生成 3×3 九宫格信息图。
- 虽然还没有独立 benchmark,但从官方示例看,它对“密集文字+复杂布局”的图片生成很强,实用性很高。
原帖也把这视为中文实验室在图像生成赛道继续高速推进的一个信号。
所属事件:阿里发布 Qwen-Image-3.0,主打密集排版与多语种文字渲染(11 条相关)→
「多模态」频道最新
- Gemini Omni Flash 把船舱直接改成了洞穴风格 — chrisfirst · 2026-07-22
- 用 Gemini、Grok 或 GPT Image 把照片转成提示词 — harshitagu72595 · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 手绘手办丢进 Seedance,效果像真的“活过来” — cocktailpeanut · 2026-07-22
- 一个 AI agent 做出的沼泽乡村 MV 在 Reddit 上走红 — LazyKaleidoscope4696 · 2026-07-22
- 实测 Qwen 3 图像生成:地图边界随提问视角变化,自带中文标签 — NirantK · 2026-07-22