把探索学习当 RL 问题:GRPO 扩散微调新方法 ExploreNet

StellaLisy · x · 2026-10-08

作者解释 ExploreNet 的动机:在 flow-matching 模型上跑 GRPO 通常每步去噪都加标准高斯噪声,但 latent 各元素敏感度不均,模型可能探索「无用」方向。与其挑选组内更有用的 rollout(浪费推理算力),作者把探索学习本身形式化为一个 RL 问题——基于当前状态预测噪声分布以最大化 reward 分散度,实现定向探索。

所属事件:ExploreNet:让扩散模型 GRPO 学会定向探索(9 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →