图像模型仍不会数圈:可验证视觉奖励 VVR 提升指令遵循
StellaLisy · x · 2026-09-29
Stella Lisy 团队指出当前图像生成模型在精确指令遵循(物体数量、空间关系)上仍然拉胯,并提出 Verifiable Visual Rewards (VVR):用几何场景程序化生成 prompt 与确定性验证器,不再依赖不可靠的奖励模型。
要点:
- 发布 VVRBench(1 万任务、32 种约束类型)与更难的 VVRBench-Challenge(720 任务),最强模型 GPT-Image-2.5-Sunburst 在 Challenge 上只解出约 21%
- 用 VVR 分数做 RL 奖励(RLVVR)后,Stable Diffusion 3.5 Medium 在 VVRBench 上从 2.8% 提升到 28.3%,且呈现易到难的泛化
- 把 VVR 混入现有后训练目标可进一步提升整体表现与人类偏好
所属事件:VVR可验证视觉奖励大幅提升图像生成指令遵循(3 条相关)→
「多模态」频道最新
- 等生成间隙弹吉他,AI 视频团队拍出人机即兴合奏短片 — mrjonfinger · 2026-09-30
- Meta LSRM 获 ECCV 2026 最佳论文提名,稀疏注意力扩展 3D 重建 — rsasaki0109 · 2026-09-30
- Meta 实验室 LSRM 获 ECCV 2026 荣誉提名,3D 重建精度大幅超越 SOTA — rsasaki0109 · 2026-09-30
- NVIDIA 推出 LongLive-Plug:蒸馏一次即可复用于 54 个下游视频模型 — nvidia · 2026-09-30
- Adobe 研究:对抗训练后处理修复像素扩散模型的高频细节缺失 — adobe-research · 2026-09-30
- UCSD 提出 LIFT:用末帧布局控制未来画面,解决大视角变化视频生成 — UCSanDiego · 2026-09-30