扩散模型应用策略梯度引发热议

关于扩散模型是否适用强化学习中的策略梯度(PG)算法引发技术圈热议。开发者指出,由于扩散模型端到端反向传播代价极其昂贵,通常极少使用策略梯度。唯一的例外可能是字节跳动的VLM奖励论文,其采用的分支回滚抽象机制在长程语言模型中才具有必要性。此外,分步生成机制导致的训练与推理不一致问题也促使多年前关于扩散模型强化学习的研究被重新提及。

2026-08-02 ~ 2026-08-02 · 3 条相关