把探索学习当 RL 问题:GRPO 扩散微调新方法 ExploreNet
StellaLisy · x · 2026-10-08
作者解释 ExploreNet 的动机:在 flow-matching 模型上跑 GRPO 通常每步去噪都加标准高斯噪声,但 latent 各元素敏感度不均,模型可能探索「无用」方向。与其挑选组内更有用的 rollout(浪费推理算力),作者把探索学习本身形式化为一个 RL 问题——基于当前状态预测噪声分布以最大化 reward 分散度,实现定向探索。
所属事件:ExploreNet:让扩散模型 GRPO 学会定向探索(9 条相关)→
「研究」频道最新
- COLM 2026 论文提出「无权重微调」,为百万用户个性化 LLM 免去 SFT — TuhinChakr · 2026-10-09
- 腾讯开源 STEPQuant:6-bit 递归状态省 68.7% 推理内存不失精度 — _akhaliq · 2026-10-09
- 斯坦福 LoT Diffusion:按细节分配 token,图像视频生成显著提速 — GordonWetzstein · 2026-10-09
- Datapoint 推出 Streams:1B+ 真人实时评分,给多模态模型做在线 RL — _akhaliq · 2026-10-09
- 提出 Agent Plasticity:衡量智能体从经验学习的效率,最强者未必最会学 — RulinShao · 2026-10-09
- BiGym 2.0 基准:LLM 写策略 1 条 demo 达 65%,不敌 π0.5 的 75% — stepjamUK · 2026-10-09