RULER: Instance-aware Rubric Rewards for SVG Generation
Hangyu Ran, Yuhao Zheng, Yingying Zhang, Kevin Qinghong Lin, Han Peng
cs.CV
2026-09-22
RULER 按每条指令现场生成语义、画面、风格六项量表,渲染后由视觉语言模型逐项打分,作为 GRPO 奖励。Qwen3-8B 的 Rubric 从 0.432/0.395 升到 0.693/0.683,对齐更大的 DeepSeek-V3。
从自然语言直接写出 SVG 代码,没有唯一正确画面。CLIP、美学分类器这类标量是在自然图像上校准的,拿到风格化矢量图上经常给坏图打高分。把它们拿去当强化学习奖励,策略就会刷分:审美分冲到 6.697,Icon 的 Rubric 反而掉到 0.262,平均长度从 0.3k 胀到 6.3k token。监督微调也只会克隆数据集模板。缺的是一条既不用配对真值、又不容易被钻空子的训练信号。
先在 900 张人工打分样本上验证:让视觉语言模型按多轴量表打分,与人类的 Spearman ρ 是 0.7929,成对排序 Goodman-Kruskal γ 是 0.7574;Aesthetic 和 CLIP 分别只有 0.6051/0.5518 和 0.5465/0.5295。
RULER 把这条评估机制改成奖励。对每条指令,用前沿模型(实验里主要是 Claude-Opus-4.6)只看文本,生成六项实例量表,分语义保真、画面质量、渲染风格三轴。条目写的是设计意图,不锁死像素路径,避免量表变成复原清单。策略模型采样 SVG,渲染后由裁判 VLM 逐项给 0 到 1 的满足度,加权平均当奖励,再用 GRPO 在组内相对打分更新。同一条指令的不同 rollout 往往在不同轴上成败不一,组内方差正好给 GRPO 用。
骨干是 Qwen3-8B,思考模式关掉,每条 prompt 采 8 条,最长 4096 token,学习率 1e-6,熵系数 0.001,奖励和 actor 损失都不用 KL 项。训练数据从 MMSVG-Icon 抽 20K、Illustration 抽 12K 条指令,写坏格式的量表会被丢掉。评测主指标是另一套通用量表,由 GPT-5-mini 独立打分,避免训练裁判自评。
MMSVG-Illustration / Icon 上,RULER 的 Rubric 从 Qwen3-8B 的 0.432/0.395 升到 0.693/0.683,超过 OmniSVG、IconShop、JanusCoder,并略高于 DeepSeek-V3 的 0.686/0.673。CLIP 和 HPS 仍有竞争力,没有靠牺牲对齐换量表分。
150 条盲测里,相对 Qwen3-8B 的非平局胜率 89.7%,相对 JanusCoder 96.5%,相对 VectorFusion 只有 53.3%。固定优化器只换奖励:CLIP+Aesthetic+HPS 会刷审美分;通用量表能到 0.660/0.591;实例量表再拉开 0.033/0.092。拿掉画面质量轴掉得最狠(0.693→0.580)。更严的 Rubric-S 反而诱发出「把提示词画进图里」的捷径,通用量表掉到 0.536。
4B 骨干同样涨:Illustration Rubric 从 0.372 到 0.561。换成 GPT-5.5 生成量表,Icon 上仍有 0.646,相对 Claude 的 0.662 差距不大。
开放式视觉代码的难点在奖励,不在优化器。实例量表把「好不好看」拆成可逐项核验的子目标,8B 模型可以追上更大的通用模型。做 SVG、图标、插画生成的人可以直接抄这套:文本生量表、渲染、VLM 打分、GRPO。它也给别的开放式生成一个提醒:标量指标能当对照,不宜当唯一奖励。
依赖两套外部模型:前沿模型写量表,VLM 打分,偏见和口味会写进奖励。每步都要渲染并查询裁判,比 CLIP 贵得多,难放大到更大模型或更长 rollout。评测主指标仍是 VLM 量表,和训练信号同族,人类盲测样本只有 150 条。三轴分解也不覆盖所有艺术意图。C+A+H 的崩盘说明奖励可黑,换一套量表设计仍可能打开新捷径。