ExploreNet 论文:扩散 RL 探索分布的形状比幅度更重要
StellaLisy · x · 2026-10-08
arXiv 论文《ExploreNet: Learning Where to Explore in Diffusion GRPO》(Stella Li、Xiaochuang Han、Yulia Tsvetkov、Luke Zettlemoyer)。
- 现有 Flow-GRPO 等方法在每个去噪步加各向同性高斯噪声,对 latent 各通道/位置一视同仁,但实际各元素对生成图像的影响差异巨大
- ExploreNet 在观察奖励前,根据当前 latent、去噪步和 prompt 预测每个 latent 元素的噪声尺度,用 rollout 组内奖励差训练,训练后即丢弃、推理开销不变
- 在 Stable Diffusion 3.5 Medium 上,held-out GenEval2 比 Flow-GRPO 提升 14%,迁移到两个独立组合性基准和五个偏好/画质模型,人类偏好胜率 67.2%
- 三条结论:探索是可学习的;探索分布的形状比幅度更重要;rollout 质量比数量更有效
- 附带人因实验:仅扰动 ExploreNet 学到的敏感通道时,标注者感知到的视觉变化明显更大
所属事件:ExploreNet:让扩散模型 GRPO 学会定向探索(9 条相关)→
「多模态」频道最新
- 斯坦福 LoT Diffusion:按细节分配 token,图像视频生成显著提速 — GordonWetzstein · 2026-10-09
- 开源 img2threejs:把参考图重建为纯代码 Three.js 模型,17.7k stars — tom_doerr · 2026-10-09
- ElevenLabs 悬赏 10 万美元寻找「世界最洗脑广告曲」,冠军独得 5 万 — alifcoder · 2026-10-09
- Suno 上线专辑功能:整合歌曲、自定义封面与曲目顺序一键发行 — suno · 2026-10-09
- 孟加拉语语音识别 WER 从 85% 骤降至 7.65%,80 家机构抢授权 Monsoon 数据集 — omarsar0 · 2026-10-09
- Magnific One 三大亮点:真人质感人脸、一次写对文字、可读信息图 — techhalla · 2026-10-09