VIEScore2:带空间定位解释的图像生成统一评测器,SRCC 0.601 超 Gemini-3-Flash
TIGER-Lab · hf · 2026-10-08
TIGER-Lab 发布 VIEScore2,一个统一的图像生成与编辑评测器,不仅给质量分数,还能定位支撑评分的缺陷区域。
技术要点:
- 将图像表示为 N×N 网格,单次前向同时预测质量分数与缺陷位置;文本原生的网格表示为异构空间监督提供统一接口,并支持可验证的后训练目标;
- 训练数据 38K,覆盖纯分数、纯定位与联合监督,横跨生成与编辑任务;
- 在监督微调基础上用 GRPO 提升缺陷定位,奖励结合 cell 级 Dice 重叠、分数准确率与输出格式有效性;
- 无参数解析器将结构化预测转为可读解释。
结果:主套件总体分 SRCC 0.601,显著高于同等输入下最强零样本通用 VLM 基线 Gemini-3-Flash 的 0.491;缺陷定位在六个基准中的三个上超越通用 VLM 与专用空间评测器,五个基准进入前三,含训练分布外数据集。
「多模态」频道最新
- 港大联合 VAST 推出 Mira-Scene,像素级对齐解决 3D 场景重建错位 — jiqizhixin · 2026-10-08
- 马斯克转发用户实测:15 秒提示词用 Grok Bot 生成完整讲解视频 — elonmusk · 2026-10-08
- AI 虚拟角色 Claudia 开源人格包:MCP 服务器+技能+角色设定全可下载 — Promptmethus · 2026-10-08
- UltraText Bench:中英双语密集文字渲染基准,Qwen-Image 复合分从 86.5 跌至 42.9 — Westlake-University · 2026-10-08
- 80 分钟 AI 长片首入国际电影节主竞赛,作者自训视觉模型 — lmoroney · 2026-10-08
- vLLM 发布 vLLM-Omni:统一服务全模态生成的技术报告出炉 — vllm_project · 2026-10-08