V-Rubrics:用评分量规 RL 提升视觉语言模型忠实度
liuziwei7 · x · 2026-08-29
新论文《V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning》针对视觉语言模型「答得流畅但视觉上错误」的问题,提出基于视觉量规的强化学习方法。
核心问题:模型答案里哪怕一个不被图像支持的对象、图表数值或推理步骤,都可能让整段看似合理的回答失效。作者认为这是多模态后训练中的信用分配失败——标量奖励只判断答案整体对错,不指出哪些视觉事实有依据、哪些推理步骤有效。
方法:
- 将参考答案分解为原子命题,从视觉忠实度(VF)、推理一致性(RC)、指令遵循(IF)三个维度打分,提供结构化部分信用;
- 基于 Qwen3-VL-8B-Instruct 在 OpenMMReasoner-SFT-874K 语料上微调得到 SFT 起点;
- 构建 V-Rubrics 50K 数据集(50,248 例,来自 17 个视觉落地数据源),用 Gemini-3-Pro 统一协议标注;
- 对比两种 GRPO 变体:标量答案信用 vs 分量级、前缀定位的量规信用。
结论:量规版 GRPO 显著优于共享 SFT 基线和 answer-only GRPO,在知识导向与视觉落地推理基准上提升最大,证明量规是视觉后训练中有效的奖励抽象。
「模型」频道最新
- Terminal-Bench 4.0 发榜:GLM-5.3 超越 GPT-5.6 — eyishazyer · 2026-08-29
- 用户实测 Minimax H3:同角色身份泄漏与长文崩坏 — Kooky-Mode3047 · 2026-08-29
- GLM-5.3-Flash 无审查权重发布,拒绝率降至 11% — lipeng0820 · 2026-08-29
- Qwen3.8 QAT Q2 实测:短答尚可,长文崩坏 — kirisoraa · 2026-08-29
- 从 Claude 切到 Codex 遇坑:Sol 陷入死循环 — kwesk · 2026-08-29
- Q4 模型在 512GB 显存下的运行预览 — burritoresearch · 2026-08-29