阿里发布 Qwen-Image-3.0,支持 4.5k token 和 10px 小字
千问大模型 · wechat · 2026-07-21
阿里千问团队正式发布 Qwen-Image-3.0,把这代图像生成模型的主线概括为三个字:实——更能装得下复杂内容、更能画出细节、也更懂现实世界里的界面与语言。
主要能力
- 内容更丰实:支持最高 4.5k token 输入,能处理报纸、分镜、试卷这类复杂版面。
- 细节更真实:可以清晰渲染 10px 小字,毛孔、发丝等微观细节也更逼真。
- 知识更厚实:支持 12 种语言 的原生渲染,也能更好地仿真网页、游戏、直播等 UI 界面。
官方展示的典型场景
- 一张提示词生成包含数学、科普、图表和文字的 9 宫格复杂信息图。
- 在同一张图里实现 VS Code → 千问聊天 → 社交聊天 → 咖啡海报 的嵌套式“画中画”。
- 渲染带复杂公式的学术论文页。
- 在书页上叠加自然的手写批注。
- 修复破损古画,同时尽量保持原有笔法与风格。
目前该模型已在 阿里云百炼 和千问平台开放邀测 API,QwenStudio 与千问 APP 也将上线免费体验。
所属事件:阿里发布 Qwen-Image-3.0,主打密集排版与多语种文字渲染(11 条相关)→
「多模态」频道最新
- 先做分镜再生成,AI 舞蹈视频更容易保持一致性 — aftahi_ai · 2026-07-22
- 交互式视频更该看响应速度,而不只是画质 — Soggy_Limit8864 · 2026-07-22
- Runpod MCP 让 Claude 直接编排图像和视频生成工作流 — 802high · 2026-07-22
- Midjourney 把蜜蜂做成碎片爆炸梗图 — michaelrabone · 2026-07-22
- 物理奖励能改进视频生成,但不等于物理引擎 — Dapper-Drawer4546 · 2026-07-22
- HeyGen 给 coding agent 接入 7.5 万图片和 1 万音乐 — HeyGen · 2026-07-22