用强化学习教模型写代码作画,图像可像代码一样编辑
thomasahle · x · 2026-09-27
一篇毕业论文项目的复盘:作者 Surya Narreddi 与 Cameron Franz 用强化学习训练语言模型生成图像,但产物不是像素而是完整的 p5.brush JavaScript 代码草图——代码即作品,因此可以像改代码一样精细编辑,而不必反复改 prompt 重跑模型。
工作原理(四步循环,训练中重复数千次)
- 模型接收 prompt(如“画一幅桃色木槿水彩画”),写出完整的 JS 草图;
- 草图在沙盒 Puppeteer 环境中渲染为 PNG;
- 从人工评分的参考画池中随机抽两幅,由独立 judge 模型将渲染结果与参考画对比择优;
- 判断结果转为奖励信号,用 GRPO 更新模型,循环继续。
核心研究问题是“如何在创意/设计任务上做 RL”:奖励必须可验证才能工作,而审美质量既不对也不错。设计问题被转化为奖励函数与 judge 的评判标准——标准太严模型会收敛趋同,太松则漂移失控。非显然的取舍在于评什么、怎么评、参考池构成与系统 prompt 的写法。
「多模态」频道最新
- 80 美元复刻 200 万美元广告:AI 创作者三模型接力做出一镜到底 — nikola_mr64990 · 2026-09-27
- 用户实测:20 分钟直出视频一刀未剪 — FuSheng_0306 · 2026-09-27
- Qwen-Image 视角环绕 LoRA:一张透明 PNG 生成全角度视图 — linoy_tsaban · 2026-09-27
- 用 Claude 一次生成宣传片,作者称此类视频外包曾超千美元 — suganthan · 2026-09-27
- Qwen 2.1 文生图极简工作流发布,细节见 Civitai 页面 — DevKkw · 2026-09-27
- Nvidia 开源 1 亿参数说话人分离模型,可实时识别 8 人 — The Decoder · 2026-09-27