UMM-Reflection:交错强化学习让统一模型自我反思修图,GenEval 提升 12 分
Yijia Fan · hf · 2026-09-29
统一多模态模型既能理解也能生成图像,理论上可以诊断自己的生成结果并迭代修复,但反思文本与图像生成需要联合学习。研究团队提出 UMM-Reflection,用强化学习优化完整的反思-生成轨迹:
- 兄弟轨迹共享同一初始图像,组相对优势用于比较不同反思策略
- 轨迹级优势同时更新反思 token 和流式图像修订,无需外部 critic,推理时也不需要验证器
- SFT 只能冷启动,朴素的只优化渲染器的 RL 会浪费大部分增益
在 BAGEL 上,UMM-Reflection 较 SFT 在 GenEval 上提升 12.05 分,且增益迁移到 WISE(+10.97)、OneIG-Bench(+3.48)、T2I-CompBench++(+4.63)等未参与训练的基准。
所属事件:UMM-Reflection 开源,交错强化学习让多模态模型自我修正图像(3 条相关)→
「多模态」频道最新
- AutoRef 开源:面向智能体多参考图生成的 Harness 优化 — NunyaBuzor · 2026-09-30
- Claude Opus 5.5 还原《戴珍珠耳环的少女》创作瞬间,网友直呼动人 — justin_hart · 2026-09-30
- Reddit 用户用 AI 制作出科幻短片《Erebus-9: The Hiveborn Archives》 — himeonisama · 2026-09-30
- 让 Claude Opus 自己标注时间戳配音:实测人机协作解说视频工作流 — RileyRalmuto · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30