扩散模型端到端强化学习引热议,多年前研究被重提

Kangwook_Lee · x · 2026-08-02

在一则关于生成模型如何通过分步生成(如自回归 LLM 预测 token 或扩散模型逐步去噪)来解决模式平均问题的讨论中,研究者 @AlexiGlad 指出这种机制会导致训练与推理不一致,进而引发误差累积(exposure bias)。

针对业界呼吁对生成模型进行端到端(e2e)训练的趋势,康威大学学者 @KangwookLee 补充指出,其实 @yingfanbot 在多年前就已经成功实现了针对扩散模型的端到端强化学习(e2e RL),为当前的技术探索提供了重要的历史参考。

所属事件:扩散模型应用策略梯度引发热议(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →