V-Rubrics 用细粒度规则强化学习提升 VLM 视觉忠实度

南洋理工大学发布 V-Rubrics 方法,针对视觉语言模型回答流畅却缺乏视觉事实支撑的问题,指出其本质是"信用分配"失败。该方法改变监督单位,将单一分数分解为视觉忠实度、推理一致性等细粒度标准,通过基于规则的强化学习与结构化部分评分机制进行训练,从而提升 VLM 输出对图像内容的忠实程度。

2026-08-27 ~ 2026-08-27 · 2 条相关