V-Rubrics:基于细粒度标准的视觉忠实度强化学习

liuziwei7 · x · 2026-08-27

针对视觉语言模型(VLM)在回答流畅但缺乏视觉事实支撑的问题,论文提出这是一种“信用分配”的失败。V-Rubrics 方法改变了监督单位,将单一分数分解为视觉忠实度(VF)、推理一致性(RC)和指令遵循(IF)三个原子标准,提供结构化的部分信用。研究构建了 50K 训练集,通过基于规则的过滤和 Gemini-3-Pro 标注,在 Qwen3-VL-8B-Instruct 上验证了该方法能有效提升模型的视觉对齐能力。

所属事件:V-Rubrics 用细粒度规则强化学习提升 VLM 视觉忠实度(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →