ExploreNet 提出可学习探索分布,改进扩散模型 GRPO 训练

StellaLisy · x · 2026-10-08

作者指出流匹配模型的 GRPO 训练中,每个去噪步加入的是各向同性高斯噪声,但 latent 各元素的敏感度并不均匀,导致模型可能探索「无用」方向。

为此其团队推出 ExploreNet:一个根据当前状态预测自适应探索分布的策略,以 rollout 多样性作为奖励,实现更快、更有针对性的扩散 RL 训练。

所属事件:ExploreNet:让扩散模型 GRPO 学会定向探索(9 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →