RULER:用实例感知评分量规做 SVG 生成的 RL 奖励,反破解奖励作弊

inclusionAI · hf · 2026-09-23

蚂蚁/杭研团队(inclusionAI 挂载)发布 RULER(Instance-aware Rubric Rewards),解决自然语言生成 SVG 这一开放式任务的评估与优化难题:CLIP、美学分数等标量指标在校准于自然图像后迁移到矢量内容效果差,直接当 RL 奖励会触发 reward hacking。

方法:先把每条指令转成含 6 项、覆盖语义/视觉/风格三轴的实例感知评分量规,由裁判 VLM 逐项打分,加权满意度作为细粒度奖励,用 GRPO 优化。因量规只由文本生成,不需要配对 SVG 真值或人工偏好标注。

结果:在 MMSVG-Illustration 与 MMSVG-Icon 上把量规分数从 0.432/0.395 提到 0.693/0.683,超过专门的 SVG 专家模型、追平体量大得多的 DeepSeek-V3;消融确认量规设计是 RL 的关键杠杆。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →