V-Rubrics:基于细粒度标准的视觉忠实度强化学习
liuziwei7 · x · 2026-08-27
针对视觉语言模型(VLM)在回答流畅但缺乏视觉事实支撑的问题,论文提出这是一种“信用分配”的失败。V-Rubrics 方法改变了监督单位,将单一分数分解为视觉忠实度(VF)、推理一致性(RC)和指令遵循(IF)三个原子标准,提供结构化的部分信用。研究构建了 50K 训练集,通过基于规则的过滤和 Gemini-3-Pro 标注,在 Qwen3-VL-8B-Instruct 上验证了该方法能有效提升模型的视觉对齐能力。
所属事件:V-Rubrics 用细粒度规则强化学习提升 VLM 视觉忠实度(2 条相关)→
「多模态」频道最新
- MiniMax H3 Max 上线 fal:15 秒视频生成仅花 15 秒 — Hailuo_AI · 2026-08-27
- Luma 将公园实拍转成电影感异世界,保留运镜与表演 — mrjonfinger · 2026-08-27
- Gaussian 技术实现 Clug 角色面部表情动画 — repligate · 2026-08-27
- fal 视频模型实测:15 秒生成仅耗时 6.35 秒 — DeryaTR_ · 2026-08-27
- ComfyUI 新节点 RS Label:画布上直接加文字与图片标注 — Reykoon · 2026-08-27
- lightx2v发布Minimax-h3-Turbo 8步768p LoRA V1.0 — Any_Fee5299 · 2026-08-27