扩散模型为何不用策略梯度?字节跳动VLM奖励或是例外
kalomaze · x · 2026-08-02
开发者指出,在连续回归被广泛应用的领域,策略梯度(PG)往往难觅踪影。最典型的例子是扩散模型领域,目前几乎没有人尝试在它身上使用类似强化学习中的策略梯度算法。
唯一的例外可能是字节跳动等团队的研究,他们尝试使用内部的视觉语言模型(VLM)作为奖励模型,探索类似 branchgrpo 的方法。
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24