扩散模型端到端反向传播昂贵,策略梯度在长程语言模型中才必要
kalomaze · x · 2026-08-02
作者 kalomaze 指出,扩散模型理论上可以端到端可微地反向传播整个链,但代价昂贵。这种昂贵性迫使采用字节跳动论文中的分支回滚抽象,而这种抽象仅在长程语言模型中才显得必要。此外,作者观察到目前几乎没有人对扩散模型使用策略梯度方法,除了字节跳动可能使用内部 VLM 奖励模型的 branchgrpo 风格工作。
「研究」频道最新
- 高斯混合模型与指数族密度逼近转换 — FrnkNlsn · 2026-08-24
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24