UMM-Reflection 开源:交错强化学习让统一模型学会自我修正图像
ziqi_huang_ · x · 2026-09-29
Ziqi Huang 等人开源 UMM-Reflection,提出用交错强化学习(interleaved RL)教统一多模态模型原生地「生成—反思—重画」:模型先诊断自己图像的错误,再修订重绘,反思文本与图像生成在同一模型内被联合训练。
方法要点
- 对完整反思轨迹做 RL:兄弟轨迹共享同一张初始图,用组内相对优势比较不同反思策略;轨迹级优势同时更新反思 token 和基于 flow 的修订模块,避免逐轮 credit assignment 的组合爆炸。
- 信用跨轮次、跨同一模型的两个角色流动,且推理时无需外部验证器(verifier)。
- SFT 冷启动只能拿到普通修复路径,无法找到高成功率的反思策略,RL 是关键增量。
成绩:在 BAGEL 上 GenEval 从 SFT 提升 12.05 个点(0.71 → 0.84),且泛化到未参与训练的 WISE(+10.97)、OneIG-Bench(+3.48)、T2I-CompBench++(+4.63)。
论文、代码、模型与 demo 均已开源放出。
所属事件:UMM-Reflection 开源,交错强化学习让多模态模型自我修正图像(3 条相关)→
「研究」频道最新
- 16 位数学家联署《莱顿宣言》:呼吁直面 AI 进军数学研究的挑战 — burny_tech · 2026-09-30
- 新研究:重复解训练出的推理能力,会在指令微调后变脆弱 — burny_tech · 2026-09-30
- Plinz:AI 不是工具,而是「构建心智」的学科,数学才刚起步 — burny_tech · 2026-09-30
- 新玩法:自举「最优结果形状」的自动研究循环 — burny_tech · 2026-09-30
- EasyPPO:固定 critic 让 PPO 回归 LLM 后训练,零训练崩溃 — teortaxesTex · 2026-09-30
- looped MoE 新配置:2 倍专家、0.5 倍循环层、2 倍循环并解绑注意力 — burny_tech · 2026-09-30