扩散模型为何不用策略梯度?字节跳动VLM奖励或是例外

kalomaze · x · 2026-08-02

开发者指出,在连续回归被广泛应用的领域,策略梯度(PG)往往难觅踪影。最典型的例子是扩散模型领域,目前几乎没有人尝试在它身上使用类似强化学习中的策略梯度算法。

唯一的例外可能是字节跳动等团队的研究,他们尝试使用内部的视觉语言模型(VLM)作为奖励模型,探索类似 branchgrpo 的方法。

所属事件:扩散模型应用策略梯度引发热议(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →