VVR可验证视觉奖励大幅提升图像生成指令遵循
Shuyue Stella Li 等研究者发布 arXiv 论文,指出当前图像生成模型在精确指令遵循(如物体数量、空间关系)上表现不佳,例如难以数清图中圆圈数量。他们提出可验证视觉奖励(VVR),用少量提示进行强化学习,使 SD3.5 的指令遵循率从 2.8% 提升至 28.3%。实测显示验证器能精准区分 RL 产出与基线渲染,正确接受 VVR 输出并拒绝基线结果。
2026-09-29 ~ 2026-09-29 · 3 条相关
- 图像模型仍不会数圈:可验证视觉奖励 VVR 提升指令遵循 — StellaLisy · 2026-09-29
- VVR 论文实测:验证器精准区分 RL 产出与基线渲染 — StellaLisy · 2026-09-29
- arXiv 论文:可验证视觉奖励让 SD3.5 指令遵循从 2.8% 升至 28.3% — testingcatalog · 2026-09-29