UMM-Reflection 开源,交错强化学习让多模态模型自我修正图像
Ziqi Huang 团队开源 UMM-Reflection,提出用交错强化学习训练统一多模态模型,使其能够原生地完成「生成—反思—重绘」的闭环:模型先诊断自己生成的图像,再迭代修复。由于修正效果只有在渲染后才能验证,反思文本与图像生成需在整个循环中联合学习、联合优化。该方法在 GenEval 基准上将得分从 0.71 提升至 0.84,提升约 12 分。
2026-09-29 ~ 2026-09-29 · 3 条相关
- UMM-Reflection:交错强化学习让统一模型自我反思修图,GenEval 提升 12 分 — Yijia Fan · 2026-09-29
- UMM-Reflection 交错强化学习让多模态模型学会自我修正,GenEval 0.71→0.84 — ziqi_huang_ · 2026-09-29
另有 1 条近重复转述:ziqi_huang_