V-Rubrics:5 万样本拆成 35 万细粒度标准,解多模态 RL 信用分配难题

jiqizhixin · x · 2026-10-04

南洋理工 S-Lab、ASTAR 与 UIUC 提出 V-Rubrics,解决多模态强化学习中的信用分配问题:模型可能看错图中一个数字、幻觉出不存在的物体,最终答案却仍正确——结果导向的 RL 照样奖励它;反之,错误答案也不代表中间观察全错。

核心做法:

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →