ExploreNet:让扩散模型 GRPO 学会定向探索

TL;DR:StellaLi、Xiaochuang Han、Yulia Tsvetkov、Luke Zettlemoyer 等人发布论文《ExploreNet: Learning Where to Explore in Diffusion GRPO》,把扩散模型 GRPO 微调中的探索噪声从固定各向同性高斯变为可学习的状态自适应分布,让 RL 训练自己学会「往哪里探索」。作者 @StellaLisy 连续多帖解读,称该方法在多个图像生成 benchmark 与人类偏好评分上超越 FlowGRPO。值得关注的结论是:探索收益来自方向而非幅度。

已确认

为什么重要

2026-10-08 ~ 2026-10-08 · 9 条相关

一手来源

另有 1 条近重复转述:StellaLisy