MEND:近端速度匹配强化学习,100 步训练超越 Flow-GRPO 约 4000 步

UTEXAS · hf · 2026-10-07

UT Austin 团队提出 MEND,一种基于近端速度匹配(proximal velocity matching)的流模型(flow model)奖励后训练强化学习方法。

方法要点

实验结果

方法通用、易采用,适用于任何带可微奖励的 flow 骨干。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →