IR4RL:把中间渲染进度变成 RL 奖励,Image-to-Code 达新 SOTA
phillip_isola · x · 2026-10-07
MIT 与合作者(Omri Kaduri、Kate Feingold、Phillip Isola、Tali Dekel)提出 IR4RL(Reinforcement Learning from Intermediate Renders),用于图像生成代码(Image-to-SVG、Image-to-TikZ)VLM 的 RL 后训练。
核心观察:现有方法只用最终渲染结果算奖励(outcome-only RL),反馈稀疏且与单个 token 贡献不对齐——一段代码可能部分正确部分出错,但所有 token 拿同样的终局奖励。而许多中间代码前缀可执行,且已渲染出有意义的局部画面。
方法:把相邻中间渲染之间的变化转成 token 级的「渲染进度奖励」(render-progress reward),为生成序列提供更密集的局部监督。
结果:在 Image-to-SVG 和 Image-to-TikZ 任务上超越监督微调和标准 GRPO,取得新的 SOTA。项目页 ir4rl.github.io 提供交互式演示,模型已上 Hugging Face,Image-to-SVG 可用,代码即将开源。
「编程与Agent」频道最新
- Hark Agent 早期实测:界面最强、自带云电脑秒执行任务 — adcock_brett · 2026-10-07
- threepointone 力荐 krazam 新作《You Are An Expert Software Engineer》 — threepointone · 2026-10-07
- Wattenberger:代码库需要区分「明确指定/暗示/agent假设」 — Wattenberger · 2026-10-07
- OpenAI Decisions API 支持图像输入,13 美分挑出 40 分钟素材最佳表情 — stevenheidel · 2026-10-07
- Embedder 单条提示词 1 小时完成 nRF52 到 nRF54 固件迁移 — ycombinator · 2026-10-07
- Brain Co 推出面向 AI Agent 的设计系统 Synapse,把设计判断写进组件 — LVidegaray · 2026-10-07