VRRL:用视觉反馈强化学习教会视觉语言模型自我纠错
gregd_nlp · x · 2026-09-04
研究者提出 VRRL,一种针对视觉语言模型的强化学习方法:VLM 常常即使视觉环境已经显示错误所在也无法纠正自己的错误,VRRL 让模型基于视觉反馈进行自我反思,在视觉接地推理任务上的分布外(OOD)准确率优于 RL 与 SFT 方法。
「研究」频道最新
- Google 用 AI 重建果蝇全脑,绘制超 16.6 万神经元图谱 — burny_tech · 2026-09-04
- 新论文:语言模型可自主控制注意力,解码成本降 52% — jm_alexia · 2026-09-04
- Pedro Domingos 提议改革同行评审:审稿只打分,与会者投票选论文 — pmddomingos · 2026-09-04
- 游戏 AI 提前跑通「反向绕圈」:reward hacking 经典案例引热议 — generativist · 2026-09-04
- Baseten 成立 Base Labs 研究组织,全面押注开源前沿模型 — baseten · 2026-09-04
- 新协议实现隐私可验证的 LLM 推理外包,本地仅需 179MB — chaumian · 2026-09-04