用强化学习训练语言模型写代码作画,代码可编辑替代反复调提示词

measure_plan · x · 2026-09-19

研究者 Surya Narreddi 与 Cameron Franz 的毕业项目探讨如何让 AI 创作过程可编辑:用强化学习训练语言模型通过写代码生成图像。核心洞察是 AI 生图只能靠提示词、无法直接修改,而代码产物天然可编辑,能精细调整而无需回到提示词。

训练采用四步循环、运行数千次:

项目更深的问题是:如何对创意/设计任务做 RL。数学有对错、游戏有胜负,美学质量没有——设计问题于是变成奖励函数与评审标准的设计:判据太严模型会收敛单一,太松则会漂移。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →