UltraText Bench:中英双语密集文字渲染基准,Qwen-Image 复合分从 86.5 跌至 42.9
Westlake-University · hf · 2026-10-08
西湖大学 LINs 实验室发布 UltraText Bench,首个针对密集视觉文字渲染的中英双语基准。随着短字符串渲染改善,评测需考察多区域长字符串的正确排布与可读性。
基准构成:
- 432 条人工审核 prompt,覆盖 24 类真实场景、三个难度等级,中英文各半;
- 每条 prompt 给出 4-12 个文本区域的精确字符串,及内容、位置、视觉属性的结构化参考;
- 用 Q-Judger VLM 对照完整参考评分,报告文字保真度、清晰度、空间质量与场景质量四维分数,并有 10 人参与人工评估校验。
发现:24 个模型配置下各维度揭示不同强弱——Z-Image-Turbo 清晰度较 Z-Image-Base 高 3.81 分,但保真度跌 14.76 分;性能随工作量显著下降,Qwen-Image-2512 英文复合分从 L1 的 86.50 跌至 L3 的 42.86。代码已开源。
「多模态」频道最新
- 港大联合 VAST 推出 Mira-Scene,像素级对齐解决 3D 场景重建错位 — jiqizhixin · 2026-10-08
- 马斯克转发用户实测:15 秒提示词用 Grok Bot 生成完整讲解视频 — elonmusk · 2026-10-08
- AI 虚拟角色 Claudia 开源人格包:MCP 服务器+技能+角色设定全可下载 — Promptmethus · 2026-10-08
- VIEScore2:带空间定位解释的图像生成统一评测器,SRCC 0.601 超 Gemini-3-Flash — TIGER-Lab · 2026-10-08
- 80 分钟 AI 长片首入国际电影节主竞赛,作者自训视觉模型 — lmoroney · 2026-10-08
- vLLM 发布 vLLM-Omni:统一服务全模态生成的技术报告出炉 — vllm_project · 2026-10-08