IR4RL:把中间渲染进度变成 RL 奖励,Image-to-Code 达新 SOTA

phillip_isola · x · 2026-10-07

MIT 与合作者(Omri Kaduri、Kate Feingold、Phillip Isola、Tali Dekel)提出 IR4RL(Reinforcement Learning from Intermediate Renders),用于图像生成代码(Image-to-SVG、Image-to-TikZ)VLM 的 RL 后训练。

核心观察:现有方法只用最终渲染结果算奖励(outcome-only RL),反馈稀疏且与单个 token 贡献不对齐——一段代码可能部分正确部分出错,但所有 token 拿同样的终局奖励。而许多中间代码前缀可执行,且已渲染出有意义的局部画面。

方法:把相邻中间渲染之间的变化转成 token 级的「渲染进度奖励」(render-progress reward),为生成序列提供更密集的局部监督。

结果:在 Image-to-SVG 和 Image-to-TikZ 任务上超越监督微调和标准 GRPO,取得新的 SOTA。项目页 ir4rl.github.io 提供交互式演示,模型已上 Hugging Face,Image-to-SVG 可用,代码即将开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →