EVR奖励模型:突破多参考图编辑一致性瓶颈
Yingmao Miao · hf · 2026-08-03
当前的图像编辑模型在多参考图编辑中难以保持视觉一致性与整体和谐。直接使用多模态大语言模型(MLLM)作为零样本评估器,容易在长文本幻觉和短文本推理能力不足之间产生矛盾。
- EVR方法:提出多维度评估-验证奖励(EVR)。将评估分解为不同的视觉标准,MLLM评估器生成多个候选假设,验证器基于具体的视觉证据接受或拒绝每个声明,从而产生可靠、细粒度的奖励信号。
- 效果:结合可扩展的数据管道,该方法无需修改架构即可对现成编辑器进行强化学习微调。在基础模型 Qwen-Image-Edit 上的实验显示,一致性与和谐度获得大幅提升,达到或超越了 NanoBanana 的水平。
「多模态」频道最新
- Seedance 视频模型实测:矢量风格图形清晰连贯 — bennash · 2026-08-03
- MiniMax H3 获 lmsysorg Day 0 支持,可本地部署于双卡 5090 — ying11231 · 2026-08-03
- 实测 Claude 自定义 Skill:输入网址一键生成产品宣传视频 — Scobleizer · 2026-08-03
- MiniMax 发布 H3 模型:原生支持 2K 音视频生成 — Mobile-Pumpkin7944 · 2026-08-03
- ComfyUI首发支持MiniMax视频模型,显存暴降66%可跑RTX 3060 — crystal_alpine · 2026-08-03
- MiniMax-H3 视频生成模型权重已上线 — blahblahsnahdah · 2026-08-03