用强化学习训练语言模型写代码作画,代码可编辑替代反复调提示词
measure_plan · x · 2026-09-19
研究者 Surya Narreddi 与 Cameron Franz 的毕业项目探讨如何让 AI 创作过程可编辑:用强化学习训练语言模型通过写代码生成图像。核心洞察是 AI 生图只能靠提示词、无法直接修改,而代码产物天然可编辑,能精细调整而无需回到提示词。
训练采用四步循环、运行数千次:
- 模型收到提示词(如“画一幅桃色木槿水彩画”),写出完整的 p5.brush JavaScript sketch;
- sketch 在沙箱化的 Puppeteer 环境中渲染为 PNG;
- 从人工评分的参考池中随机抽两幅画,由独立评审模型比较优劣;
- 评审结果经 GRPO 转化为奖励信号,更新模型。
项目更深的问题是:如何对创意/设计任务做 RL。数学有对错、游戏有胜负,美学质量没有——设计问题于是变成奖励函数与评审标准的设计:判据太严模型会收敛单一,太松则会漂移。
「多模态」频道最新
- Grok Imagine 9 天做出好莱坞级片段:3627 张图仅花 2677 美元 — NicoVerderosa · 2026-09-19
- Reddit 分享:意式 80/90 年代 Canzone 风格音乐 LoRA — -becausereasons- · 2026-09-19
- Invideo 编辑器上线 Sound Design:Agent 自动分析并修复视频音效 — azed_ai · 2026-09-19
- 从 GTX1070ti 升级 RTX5070ti 后,Comfy 生成提速超十倍 — Nesachi1 · 2026-09-19
- fal 推出 H3 Max 唇形同步模型:中位生成仅 11 秒,质量速度双第一 — jfischoff · 2026-09-19
- 用户用 Seedance 2 制作 AI 狩猎短片引发关注 — Ok-Nerve941 · 2026-09-19