扩散模型端到端强化学习引热议,多年前研究被重提
Kangwook_Lee · x · 2026-08-02
在一则关于生成模型如何通过分步生成(如自回归 LLM 预测 token 或扩散模型逐步去噪)来解决模式平均问题的讨论中,研究者 @AlexiGlad 指出这种机制会导致训练与推理不一致,进而引发误差累积(exposure bias)。
针对业界呼吁对生成模型进行端到端(e2e)训练的趋势,康威大学学者 @KangwookLee 补充指出,其实 @yingfanbot 在多年前就已经成功实现了针对扩散模型的端到端强化学习(e2e RL),为当前的技术探索提供了重要的历史参考。
「研究」频道最新
- 高斯混合模型与指数族密度逼近转换 — FrnkNlsn · 2026-08-24
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24