RULER:用实例感知评分量规做 SVG 生成的 RL 奖励,反破解奖励作弊
inclusionAI · hf · 2026-09-23
蚂蚁/杭研团队(inclusionAI 挂载)发布 RULER(Instance-aware Rubric Rewards),解决自然语言生成 SVG 这一开放式任务的评估与优化难题:CLIP、美学分数等标量指标在校准于自然图像后迁移到矢量内容效果差,直接当 RL 奖励会触发 reward hacking。
方法:先把每条指令转成含 6 项、覆盖语义/视觉/风格三轴的实例感知评分量规,由裁判 VLM 逐项打分,加权满意度作为细粒度奖励,用 GRPO 优化。因量规只由文本生成,不需要配对 SVG 真值或人工偏好标注。
结果:在 MMSVG-Illustration 与 MMSVG-Icon 上把量规分数从 0.432/0.395 提到 0.693/0.683,超过专门的 SVG 专家模型、追平体量大得多的 DeepSeek-V3;消融确认量规设计是 RL 的关键杠杆。
「多模态」频道最新
- Mirage 推 Tesseract:让 AI Agent 直接操控视频创作引擎 — ccerrato147 · 2026-09-23
- Reddit 用户用 Opus 5.5 一次生成 7 分钟教程视频 — thatisnotmychapstick · 2026-09-23
- Flux 3 分屏渲染实测:双视角细节高度同步碾压同类模型 — umesh_ai · 2026-09-23
- PixVerse 发布 R2 实时世界模型:动作有因果,火点燃草改变剧情 — alifcoder · 2026-09-23
- 独行者用 MiniMax+Tripo+Blender 做出战斗短片,公开完整流程求指点 — Spoonman915 · 2026-09-23
- RTX 4060 8GB 跑 MiniMax H3 转场视频,作者分享 seed 漂移应对法 — Far_Cast_Far_Wide · 2026-09-23