ExploreNet:让扩散模型 GRPO 学会定向探索
TL;DR:StellaLi、Xiaochuang Han、Yulia Tsvetkov、Luke Zettlemoyer 等人发布论文《ExploreNet: Learning Where to Explore in Diffusion GRPO》,把扩散模型 GRPO 微调中的探索噪声从固定各向同性高斯变为可学习的状态自适应分布,让 RL 训练自己学会「往哪里探索」。作者 @StellaLisy 连续多帖解读,称该方法在多个图像生成 benchmark 与人类偏好评分上超越 FlowGRPO。值得关注的结论是:探索收益来自方向而非幅度。
已确认
- 动机:flow-matching 模型上跑 GRPO 通常每个去噪步注入标准高斯噪声,所有 latent 元素噪声分布相同,但各元素敏感度不均,模型可能探索「无用」方向。
- 方法:ExploreNet 根据当前状态预测自适应探索分布,以 reward 分散度为目标进行学习;相比挑选组内更有用的 rollout,不额外浪费推理算力。
- 结果:以 FlowGRPO(各向同性探索噪声)为基线,ExploreNet 在多个图像生成 benchmark 和人类偏好评分上更优,其生成图像在 86.1% 的情况下偏离基线更远。
- 消融一(幅度对齐):ExploreNet 学到的噪声平均幅度是各向同性高斯噪声的 1.4 倍,但把幅度对齐后改回各向同性噪声,收益消失——证明关键在「定向探索」而非噪声更大。
- 消融二(通道敏感度):模型给「改变图像更多」的 latent 通道分配了更大的噪声尺度,探索自动适应了 latent 空间的敏感度结构。
- 消融三(人类感知):让标注者只看单一 latent 通道被扰动的图像打分,模型学会放大的通道被扰动时人眼感知差异明显更大,说明学到的探索方向确实对齐「改变图像」这一目标。
为什么重要
- 该工作把「探索」本身当作 RL 学习对象,而非依赖手工设定的噪声先验,为扩散模型 RL 微调提供了新范式。
- 「形状比幅度更重要」的发现对未来设计扩散策略的探索机制有直接参考价值。
2026-10-08 ~ 2026-10-08 · 9 条相关
一手来源
- ExploreNet 论文:扩散 RL 探索分布的形状比幅度更重要 — StellaLisy ·
- ExploreNet 超越 FlowGRPO:扩散模型探索噪声可以学习 — StellaLisy ·
- 把探索学习当 RL 问题:GRPO 扩散微调新方法 ExploreNet — StellaLisy ·
- ExploreNet 提出可学习探索分布,改进扩散模型 GRPO 训练 — StellaLisy · 2026-10-08
- latent 敏感度不均,GRPO 探索需要适应各元素 — StellaLisy · 2026-10-08
- 【源头】ExploreNet 超越 FlowGRPO:扩散模型探索噪声可以学习 — StellaLisy · 2026-10-08
- ExploreNet 生成的图像 86.1% 情况下偏离基线更远 — StellaLisy · 2026-10-08
- ExploreNet 关键发现:定向探索比噪声大小更有效 — StellaLisy · 2026-10-08
- ExploreNet 会给改变图像更多的通道分配更大噪声 — StellaLisy · 2026-10-08
- ExploreNet 消融:扰动高敏通道时人眼感知差异更大 — StellaLisy · 2026-10-08
- 【源头】ExploreNet 论文:扩散 RL 探索分布的形状比幅度更重要 — StellaLisy · 2026-10-08
另有 1 条近重复转述:StellaLisy