MEND:近端速度匹配强化学习,100 步训练超越 Flow-GRPO 约 4000 步
UTEXAS · hf · 2026-10-07
UT Austin 团队提出 MEND,一种基于近端速度匹配(proximal velocity matching)的流模型(flow model)奖励后训练强化学习方法。
方法要点
- 对每个 prompt 组内的奖励设置上限,已得分足够高的样本不再更新。
- 低于上限时沿奖励梯度提出移动,仅当封顶后的奖励增益超过二次位移代价时才接受。
- 模型回归到所得速度目标,无需 KL 项、冻结参考模型或优势权重。
实验结果
- 仅 100 步更新,MEND 在 6 个评估器中的 5 个上超越需要约 4000 步的 Flow-GRPO,且与基础模型的图像距离相当。
- 等预算协议下,在 4 种训练奖励的所有评估点均超越 ReFL 与 DiffusionNFT(PickScore 24.03 vs 23.92/23.43)。
- 300 步的三奖励训练即可在全部三项奖励上超越五奖励训练的 DiffusionNFT。
方法通用、易采用,适用于任何带可微奖励的 flow 骨干。
「多模态」频道最新
- 用 Opus 5.5 + Higgsfield 做电商产品展示动画 — Tegadesigns · 2026-10-07
- Gemini Omni 1.1 实测:用对了方法成片连贯度出人意料 — Cold_Solder_ · 2026-10-07
- EmbeddingGemma 2 多模态搜索演示:一次检索图视频音频 — tomaarsen · 2026-10-07
- 近 4 分钟 AI 科幻预告片 MORO:Agent Two 生成+AI 辅助后期 — LudovicCreator · 2026-10-07
- 独立游戏开发者用 GPT 生成 1200+ 张美术素材,称效率百倍于手绘 — MosskeepForest · 2026-10-07
- AI 视频挑战赛获奖作品:凡尔赛宫搬到火星的 Age Collision — Loo_Atreides · 2026-10-07