VRRL:用视觉反馈强化学习教会视觉语言模型自我纠错

gregd_nlp · x · 2026-09-04

研究者提出 VRRL,一种针对视觉语言模型的强化学习方法:VLM 常常即使视觉环境已经显示错误所在也无法纠正自己的错误,VRRL 让模型基于视觉反馈进行自我反思,在视觉接地推理任务上的分布外(OOD)准确率优于 RL 与 SFT 方法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →