MIT 提出 IR4RL:用中间渲染进度作 RL 奖励刷新 Image-to-Code
MIT 的 Omri Kaduri、Kate Feingold、Phillip Isola、Tali Dekel 等研究者提出 IR4RL 方法:image-to-code 模型在生成过程中是逐步构建图像的,他们发现可以把这一过程中的中间渲染结果作为密集强化学习奖励信号来训练视觉生成模型。实验显示该方法使 Image-to-Code 任务达到新的 SOTA,为视觉生成模型的强化学习训练提供了新思路。
2026-10-07 ~ 2026-10-07 · 2 条相关
- IR4RL:把中间渲染进度变成 RL 奖励,Image-to-Code 达新 SOTA — phillip_isola · 2026-10-07
- MIT 等提出 IR4RL:用中间图像渲染给视觉生成模型密集 RL 奖励 — CSProfKGD · 2026-10-07