ExploreNet 超越 FlowGRPO:扩散模型探索噪声可以学习

StellaLisy · x · 2026-10-08

StellaLisy 连发介绍新工作 ExploreNet:在 flow-matching 模型的 GRPO 微调中,不再用固定的各向同性高斯噪声做探索,而是学习一个基于状态的噪声分布来最大化 reward 分散度。相比 FlowGRPO 基线,ExploreNet 在多个图像生成 benchmark 与人类偏好评分上均更优,且学习动态显示收益随训练快速累积。

所属事件:ExploreNet:让扩散模型 GRPO 学会定向探索(9 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →