V-Rubrics:用评分量规 RL 提升视觉语言模型忠实度

liuziwei7 · x · 2026-08-29

新论文《V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning》针对视觉语言模型「答得流畅但视觉上错误」的问题,提出基于视觉量规的强化学习方法。

核心问题:模型答案里哪怕一个不被图像支持的对象、图表数值或推理步骤,都可能让整段看似合理的回答失效。作者认为这是多模态后训练中的信用分配失败——标量奖励只判断答案整体对错,不指出哪些视觉事实有依据、哪些推理步骤有效。

方法:

结论:量规版 GRPO 显著优于共享 SFT 基线和 answer-only GRPO,在知识导向与视觉落地推理基准上提升最大,证明量规是视觉后训练中有效的奖励抽象。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →