ExploreNet 超越 FlowGRPO:扩散模型探索噪声可以学习
StellaLisy · x · 2026-10-08
StellaLisy 连发介绍新工作 ExploreNet:在 flow-matching 模型的 GRPO 微调中,不再用固定的各向同性高斯噪声做探索,而是学习一个基于状态的噪声分布来最大化 reward 分散度。相比 FlowGRPO 基线,ExploreNet 在多个图像生成 benchmark 与人类偏好评分上均更优,且学习动态显示收益随训练快速累积。
所属事件:ExploreNet:让扩散模型 GRPO 学会定向探索(9 条相关)→
「多模态」频道最新
- 斯坦福 LoT Diffusion:按细节分配 token,图像视频生成显著提速 — GordonWetzstein · 2026-10-09
- 开源 img2threejs:把参考图重建为纯代码 Three.js 模型,17.7k stars — tom_doerr · 2026-10-09
- ElevenLabs 悬赏 10 万美元寻找「世界最洗脑广告曲」,冠军独得 5 万 — alifcoder · 2026-10-09
- Suno 上线专辑功能:整合歌曲、自定义封面与曲目顺序一键发行 — suno · 2026-10-09
- 孟加拉语语音识别 WER 从 85% 骤降至 7.65%,80 家机构抢授权 Monsoon 数据集 — omarsar0 · 2026-10-09
- Magnific One 三大亮点:真人质感人脸、一次写对文字、可读信息图 — techhalla · 2026-10-09