V-Rubrics:5 万样本拆成 35 万细粒度标准,解多模态 RL 信用分配难题
jiqizhixin · x · 2026-10-04
南洋理工 S-Lab、ASTAR 与 UIUC 提出 V-Rubrics,解决多模态强化学习中的信用分配问题:模型可能看错图中一个数字、幻觉出不存在的物体,最终答案却仍正确——结果导向的 RL 照样奖励它;反之,错误答案也不代表中间观察全错。
核心做法:
- 将 50,248 个视觉样本拆解为 352,938 条可逐条核验的标准(criteria);
- 视觉事实、推理步骤、任务要求分别参与奖励计算,把正确观察与错误推理区分开;
- 每条标准的得分输入 GRPO 强化学习,强化对的部分、纠正错的部分。
「多模态」频道最新
- 不会写代码的作者用 Suno+Kling+Claude 做出全 AI 歌曲MV — Afinetheorem · 2026-10-04
- 疑似新款 Nano Banana Pro 被曝光,发布时间未知或不在近期 — koltregaskes · 2026-10-04
- Looped-DiT:2.6 亿参数循环计算跑赢 6.5 倍大模型,推理算力省 4.9 倍 — Apprehensive_Sky892 · 2026-10-04
- Qwen Image 2.1 编辑增强节点:参考图与短语级注意力可控 — Capitan01R- · 2026-10-04
- 博主实测 Eleven v4 语音输出首次零修改可用,免费期还剩 9 天 — FellMentKE · 2026-10-04
- AdScanVideo 一键上传任意视频,自动生成逐时间戳结构化分析报告 — aftahi_ai · 2026-10-04