UMM-Reflection 交错强化学习让多模态模型学会自我修正,GenEval 0.71→0.84
ziqi_huang_ · x · 2026-09-29
Ziqi Huang 团队开源 UMM-Reflection,用交错强化学习教会统一多模态模型生成、反思并重绘图像。由于修正效果只有渲染后才知道,反思文本与图像生成需在整个循环中联合学习。
- 方法:在同一样本上共享初始图像的兄弟轨迹间做组相对优势比较,一条轨迹级优势同时更新反思 token 和流式修正,推理时无需外部验证器
- 在 BAGEL 上 GenEval 较 SFT 提升 12.05 分(0.71→0.84)
- 增益可迁移到训练未见的 WISE(+10.97)、T2I-CompBench++(+4.63)、OneIG(+3.48)
所属事件:UMM-Reflection 开源,交错强化学习让多模态模型自我修正图像(3 条相关)→
「研究」频道最新
- VLANeXt Family:500+ 控制实验提炼 12 条 VLA 模型实用配方 — ccloy · 2026-09-30
- RL with Confidence Margin 论文:让置信度逐步追踪推理正确性 — EliasEskin · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- 南科大 ActFirst-OPD:先行动后思考,多轮智能体蒸馏训练提速最高 4.9 倍 — SouthernUniversityofScienceandTechnology · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30
- 美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36% — meituan · 2026-09-30