arXiv 论文:可验证视觉奖励让 SD3.5 指令遵循从 2.8% 升至 28.3%
testingcatalog · x · 2026-09-29
Shuyue Stella Li、Xiaochuang Han、Yulia Tsvetkov、Luke Zettlemoyer 发布 arXiv 论文《Verifiable Visual Rewards Transfer from Synthetic Scenes to Natural Prompts》。
- 问题:图像生成的精确指令遵循(物体数量、空间关系)仍是开放难题,部分原因是训练依赖不可靠的奖励模型(物体检测器、VLM)
- 方法:VVR 是首个可编程验证的图像奖励框架——每个任务是一组几何物体及其关系,prompt 与确定性验证器自动生成,可无限扩展任意复杂度
- 数据:发布 VVRBench(10,000 任务、32 类约束)与 VVRBench-Challenge(720 个更难任务);最强的 GPT-Image-2.5 仅解出 21.4%
- 结果:RLVVR 将 Stable Diffusion 3.5 Medium 在 VVRBench 上的准确率从 2.8% 提至 28.3%,并有一致的易到难泛化与域外迁移;把 VVR 混入现有目标进一步提升整体性能与人类偏好,作者主张将其纳入标准图像后训练流程
论文 33 页,代码与 benchmark 均已开源。
所属事件:VVR可验证视觉奖励大幅提升图像生成指令遵循(3 条相关)→
「多模态」频道最新
- Claude Opus 5.5 还原《戴珍珠耳环的少女》创作瞬间,网友直呼动人 — justin_hart · 2026-09-30
- Reddit 用户用 AI 制作出科幻短片《Erebus-9: The Hiveborn Archives》 — himeonisama · 2026-09-30
- 让 Claude Opus 自己标注时间戳配音:实测人机协作解说视频工作流 — RileyRalmuto · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30
- KAIST 推出 Thinking Reward Model:先定评分细则再审图,开源奖励模型登顶 — Xuehai Bai · 2026-09-30