ExploreNet 提出可学习探索分布,改进扩散模型 GRPO 训练
StellaLisy · x · 2026-10-08
作者指出流匹配模型的 GRPO 训练中,每个去噪步加入的是各向同性高斯噪声,但 latent 各元素的敏感度并不均匀,导致模型可能探索「无用」方向。
为此其团队推出 ExploreNet:一个根据当前状态预测自适应探索分布的策略,以 rollout 多样性作为奖励,实现更快、更有针对性的扩散 RL 训练。
所属事件:ExploreNet:让扩散模型 GRPO 学会定向探索(9 条相关)→
「多模态」频道最新
- 斯坦福 LoT Diffusion:按细节分配 token,图像视频生成显著提速 — GordonWetzstein · 2026-10-09
- 开源 img2threejs:把参考图重建为纯代码 Three.js 模型,17.7k stars — tom_doerr · 2026-10-09
- ElevenLabs 悬赏 10 万美元寻找「世界最洗脑广告曲」,冠军独得 5 万 — alifcoder · 2026-10-09
- Suno 上线专辑功能:整合歌曲、自定义封面与曲目顺序一键发行 — suno · 2026-10-09
- 孟加拉语语音识别 WER 从 85% 骤降至 7.65%,80 家机构抢授权 Monsoon 数据集 — omarsar0 · 2026-10-09
- Magnific One 三大亮点:真人质感人脸、一次写对文字、可读信息图 — techhalla · 2026-10-09