latent 敏感度不均,GRPO 探索需要适应各元素
StellaLisy · x · 2026-10-08
作者指出:flow-matching 模型的 GRPO 通过在每个去噪步骤注入标准高斯噪声实现,但每个 latent 元素的噪声分布完全相同;latent 的敏感度其实不均,模型可能探索「无用」方向。探索应当适应每个 latent 元素的敏感度。
所属事件:ExploreNet:让扩散模型 GRPO 学会定向探索(9 条相关)→
「研究」频道最新
- COLM 论文:后训练数据中的「岔路口」让推理模型覆盖变窄 — ParshinShojaee · 2026-10-09
- Weyaxi 开源 TermGrade:1000 个可执行终端 Agent RL 环境,附完整训练配方 — maximelabonne · 2026-10-09
- 基因组深度学习工具包 tangermeme 登 Nature Methods,聚焦顺式调控逻辑解读 — jmschreiber91 · 2026-10-09
- Google 医疗开源模型 MedGemma 论文登上 Nature Medicine — ymatias · 2026-10-09
- DuoMatching:联合-边际分布匹配实现少步视频生成 — Total-Resort-3120 · 2026-10-09
- TIDE 论文:把训练数据归因蒸馏成低维嵌入,查询即最近邻 — serrjoa · 2026-10-09