UMM-Reflection 开源:交错强化学习让统一模型学会自我修正图像

ziqi_huang_ · x · 2026-09-29

Ziqi Huang 等人开源 UMM-Reflection,提出用交错强化学习(interleaved RL)教统一多模态模型原生地「生成—反思—重画」:模型先诊断自己图像的错误,再修订重绘,反思文本与图像生成在同一模型内被联合训练。

方法要点

成绩:在 BAGEL 上 GenEval 从 SFT 提升 12.05 个点(0.71 → 0.84),且泛化到未参与训练的 WISE(+10.97)、OneIG-Bench(+3.48)、T2I-CompBench++(+4.63)。

论文、代码、模型与 demo 均已开源放出。

所属事件:UMM-Reflection 开源,交错强化学习让多模态模型自我修正图像(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →