ExploreNet 关键发现:定向探索比噪声大小更有效
StellaLisy · x · 2026-10-08
作者对比 ExploreNet 与 FlowGRPO 的探索机制:ExploreNet 学习的噪声平均幅度是各向同性高斯噪声的 1.4 倍。将幅度对齐但改回各向同性噪声后收益消失,证明关键在于「定向探索」而非噪声更大。ExploreNet 在更小的组大小和更少去噪步数下也能工作。
所属事件:ExploreNet:让扩散模型 GRPO 学会定向探索(9 条相关)→
「研究」频道最新
- COLM 2026 论文提出「无权重微调」,为百万用户个性化 LLM 免去 SFT — TuhinChakr · 2026-10-09
- 腾讯开源 STEPQuant:6-bit 递归状态省 68.7% 推理内存不失精度 — _akhaliq · 2026-10-09
- 斯坦福 LoT Diffusion:按细节分配 token,图像视频生成显著提速 — GordonWetzstein · 2026-10-09
- NVIDIA 等发布 Long-WAM:19.2 秒视觉上下文让机器人任务成功率升至 78.7% — songhan_mit · 2026-10-09
- Datapoint 推出 Streams:1B+ 真人实时评分,给多模态模型做在线 RL — _akhaliq · 2026-10-09
- 提出 Agent Plasticity:衡量智能体从经验学习的效率,最强者未必最会学 — RulinShao · 2026-10-09