扩散模型端到端反向传播昂贵,策略梯度在长程语言模型中才必要

kalomaze · x · 2026-08-02

作者 kalomaze 指出,扩散模型理论上可以端到端可微地反向传播整个链,但代价昂贵。这种昂贵性迫使采用字节跳动论文中的分支回滚抽象,而这种抽象仅在长程语言模型中才显得必要。此外,作者观察到目前几乎没有人对扩散模型使用策略梯度方法,除了字节跳动可能使用内部 VLM 奖励模型的 branchgrpo 风格工作。

所属事件:扩散模型应用策略梯度引发热议(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →