ExploreNet 关键发现:定向探索比噪声大小更有效

StellaLisy · x · 2026-10-08

作者对比 ExploreNet 与 FlowGRPO 的探索机制:ExploreNet 学习的噪声平均幅度是各向同性高斯噪声的 1.4 倍。将幅度对齐但改回各向同性噪声后收益消失,证明关键在于「定向探索」而非噪声更大。ExploreNet 在更小的组大小和更少去噪步数下也能工作。

所属事件:ExploreNet:让扩散模型 GRPO 学会定向探索(9 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →