NTU提出V-Rubrics:35万条准则拆解多模态奖励,MMMU最高涨2.6分

机器之心 · wechat · 2026-09-26

核心问题:结果奖励的信用分配困境

多模态模型即使推理过程连贯,也可能读错图表数字或写入画面中不存在的物体。若最终答案恰好正确,按结果评分的训练会把「看似正确、实则推理错误」的回答一并奖励;反之答案错了,其中正确的观察也被一并否定。

南洋理工大学 S-Lab、ASTAR 与 UIUC 团队提出 V-Rubrics,用逐项评分(rubrics)解决信用分配问题,论文已被 EMNLP 2026 主会接收,代码与数据开源。

方法:把视觉证据写进奖励

将一条视觉回答拆成三类原子准则:

每条 rubric 只检查一个原子项、表述简短且自包含,并带重要性标签与权重:Essential/Important/Optional 正向权重 15,Pitfall 标为 -1 或 -2。视觉问答采用 VF ≫ RC ≈ IF 的优先级。

数据:50K 题 → 352,938 条准则

V-Rubrics 50K 从 17 个公开视觉数据源采样,覆盖图表文档问答、示意图、视觉数学、计数、教育问答与通用视觉推理。用 SFT 模型对每题回答 8 次,全对的剔除,其余按答对比例分难度:hard 占 36.1%、medium 50.4%、simple 13.6%。

最终 50,248 个样本由 Gemini-3-Pro 生成 352,938 条 rubric:VF 209,436 条(59.3%)、RC 101,369 条(28.7%)、IF 42,133 条(11.9%)。训练时 verifier 只读生成回复与自包含准则,不直接读原图。

训练:避免 reward 坍缩

答案正确性与 rubric 满足度各以 0.5 权重计入语义奖励,另保留格式奖励。答案得分与各条正向 rubric 得分分别在同一组 rollout 中标准化:最终答案信号覆盖整段回复,每条 rubric 保留独立优势信号。verifier 返回判断对应的原文证据句,通过模糊匹配定位,该 rubric 的 advantage 只作用于从回复开头到证据句末尾的前缀;无法定位则回退到整条 response。Pitfall 触发时否决该回复的答案信用与正向 rubric 信用。

结果

以 Qwen3-VL-8B-Instruct 为 base,经 OpenMMReasoner-SFT-874K 微调后从同一 checkpoint 分别训练答案级 GRPO 与 rubric GRPO,使用同一批数据与采样预算:

消融显示:仅加入 rubric 评分但仍合成序列级标量,Overall Avg. 即从 66.25 升至 67.74(+1.49);再叠加组件级标准化与前缀定位,进一步到 68.04(+0.30)。

案例

人像题中,答案级模型正确数出 4 人却凭外貌推断某人超过 70 岁、出生于 1945 年前,最终答 3 人;rubric 训练后模型补出了年龄与出生年份的推算。函数图像题中,答案级模型把函数值首次达到 2 的位置误读为 x=4,rubric 模型逐段读图得到 x=2。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →