MIT 等提出 IR4RL:用中间图像渲染给视觉生成模型密集 RL 奖励

CSProfKGD · x · 2026-10-07

一篇来自 Tal Dekel、Phillip Isola 等研究者的新工作 IR4RL:image-to-code 模型是逐步构建图像的,作者发现把生成过程中的中间 token 轨迹翻译成中间图像渲染,可以提供比最终结果密集得多的 RL 奖励信号,从而对 VLM 的 inverse-vision(逆向视觉)任务做 RL 后训练,显著提升效果。

核心思路:不再只在整张图完成后给奖励,而是每画一部分就对照当前渲染与目标图像打分,让学习信号更稠密、更高效。

所属事件:MIT 提出 IR4RL:用中间渲染进度作 RL 奖励刷新 Image-to-Code(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →