V-Rubrics: Improving Visual Faithfulness via Rubric-Based Reinforcement Learning

liuziwei7 · x · 2026-08-27

Addressing the issue where Vision-Language Models (VLMs) produce fluent but visually ungrounded answers, this paper frames it as a credit-assignment failure. V-Rubrics decomposes supervision into atomic criteria: Visual Faithfulness, Reasoning Consistency, and Instruction Following. Validated on Qwen3-VL-8B-Instruct with a 50K-example dataset, the method provides structured partial credit, significantly improving model grounding.

Related event: V-Rubrics: Rule-Based RL Boosts VLM Visual Faithfulness(2 posts)→

Original post →

More from Multimodal

Multimodal channel →