V-Rubrics 用细粒度规则强化学习提升 VLM 视觉忠实度
南洋理工大学发布 V-Rubrics 方法,针对视觉语言模型回答流畅却缺乏视觉事实支撑的问题,指出其本质是"信用分配"失败。该方法改变监督单位,将单一分数分解为视觉忠实度、推理一致性等细粒度标准,通过基于规则的强化学习与结构化部分评分机制进行训练,从而提升 VLM 输出对图像内容的忠实程度。
2026-08-27 ~ 2026-08-27 · 2 条相关
- V-Rubrics:基于规则强化学习的视觉保真度 — nanyang-technological-university-singapore · 2026-08-27
- V-Rubrics:基于细粒度标准的视觉忠实度强化学习 — liuziwei7 · 2026-08-27