300 个可验证任务让视频生成学会可迁移视觉推理

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai

cs.CV, cs.AI, cs.LG, cs.MM, cs.RO

2026-08-27

VBVR-Pro 用 300 个程序化任务和确定性打分器,把原生视觉推理做成可训练闭环。训完的 Wan2.2-I2V-A14B 在七个外部基准上最高提升约 28 个百分点。

这篇在解决什么

语言模型把推理几乎全压在文字链上。空间变换、物体持久、时序跟踪这类能力,语言能描述,却不是天然介质。原生视觉推理换了一条路:模型靠生成图像和视频来解题,中间的视觉状态是工作记忆,不只是输入,也不只是最后一张图。

这条路缺三样底座。现有基准大多只能评、不能训;评测又大量把 VLM 当裁判,对计数、空间关系和规则约束经常打偏,同一条视频把温度设成 0 也会改分。图像、交错图文、视频三种生成器很少在同一任务分布上对照。VBVR-Pro 冲着这三件事搭闭环试验台。

方法

任务先铺成可扩展的程序空间。300 个任务各带参数:采样网格大小、物体数、布局、外观和难度,再由任务求解器给出标准答案,不靠人工标注。150 个从前作 VBVR 重写,150 个新做。新任务更密、更深:抽样帧上中位数 80 个连通色块,对侧重写任务是 12;47% 需要多步搜索,对侧重写任务只有 7%;盲评 150 对里有 113 对判定新任务推理更深。同一道题同时渲成视频、关键帧图像和交错文本,三种生成器吃的是同一套题。训练用 250 个任务、每任务 5000 条,共 125 万条,另留 5 万条给强化学习。评测集 VBVR-Pro-Bench 含 50 个训练过的任务族和 50 个完全没见过的任务族,共 100 题、每题 5 个实例。

打分器不比像素,比语义实体。HSV 分割、轮廓、OCR、跨帧跟踪抽出颜色、形状、位置和数量,再按任务规则加权,硬约束则连乘,碰墙就接近零分。VLM 裁判复现实验里,54.6% 到 92.8% 的样本会改分;规则打分器跨次运行分值完全一样。

强化学习需要语义级探索:迷宫左转还是右转,低噪声采样往往只改纹理、不改决定。普通 Flow-SDE 把随机性加大后画面先烂。改用 CPS(Coefficients-Preserving Sampling,系数守恒采样),把调度器规定的噪声系数拆成预测噪声加新采样噪声,加大探索时不额外堆噪声。对照实验共用算法、数据和初始化,只把奖励从 Qwen3.6-27B 换成规则打分器。

结果

开源生成器在套件上普遍很弱,缺的是任务相关数据。九个开源模型在 VBVR-Pro 上训一轮,总体平均涨 0.290,域内 +0.401,域外 +0.179。最强视频模型 VBVR-Pro-Wan2.2-I2V-A14B 总体 0.670,基座只有 0.182;最强交错模型 VBVR-Pro-SenseNova-U1 总体 0.638。商业模型里 Seedream-5.0-Pro 图像 0.557,Nano Banana Pro 交错 0.564,Seedance 2.0 视频 0.499。单图生成在变换类任务上掉得最明显,终点图装不下中间状态。

交错消融把账算清了。中间视觉轨迹压成单图,SenseNova 总体从 0.638 掉到 0.527;中间文本换成无意义占位,几乎不动,0.629。推理时干预同样:去掉中间图掉到 0.099,去掉或改反中间文本大约还剩 0.53。输入图整张拿掉只剩 0.064。视觉轨迹是工作记忆,文字是配角。

外部迁移看最强视频模型:

基准基座 Wan2.2训后Veo 3.1
V-ReasonBench10.2138.2224.25
VideoThinkBench mini25.7152.8627.69
MME-CoF-Pro24.7648.3955.90
RULER-Bench57.8966.9665.19
RISE-Video62.8366.1876.40
BabyVision-Gen0.3612.50

形状类比、积木排序、机器人抓取,画面和训练的抽象拼图差很远。CLIP、DINOv2 近邻也对不上训练样本。前作 VBVR 训过的同一骨干在 V-ReasonBench 是 18.05,Pro 再训到 38.22,多出来的 150 个更难任务不是在刷同类实例。

规则奖励的 RLVR 从已经 SFT 过的 Wan2.2-TI2V-5B 再训,总体 0.548,同数据再 SFT 是 0.503,VLM 奖励是 0.508。域外从 0.328 到 0.377。迷宫一例,RL 前轨迹分 0.2249,之后 0.8692,中间走廊也连得上。

人类对齐上,规则打分器逐票一致率超过 0.60,GPT-5.5 是 0.54,Gemini-3.1-Pro 是 0.52,大约摸到人类上限 0.77 的 78%。模型级 Spearman ρ 域内 0.95、域外 1.00。

为什么重要

做「生成即推理」的人,缺的是能训、能验、能对照的底座。任务覆盖做成可扩展程序,奖励从贵且不稳的 VLM 换成便宜、可复现的规则,并在 50 个任务上把多任务 RL 跑通。要跟的话,优先用它的数据和打分器,别把商业 VLM 直接当奖励。交错生成在域内能接近视频、推理更便宜;需要细粒度状态跟踪或出域迁移时,视频仍然更强。

这是基础设施论文。增益来自任务覆盖和可验证反馈,不是来自新骨架。

局限与存疑

论文没有单独的局限节,数字自己露出缝。最强训后模型仍远低于人类。域外比域内低一截,最强视频 0.532 对 0.808,任务族一换就掉。打分器绑在程序化渲染上,靠 HSV 和轮廓抽实体,换到照片级输出未必还能当奖励。交错文本由 Gemini-3.1-Pro 代写,文本质量上限在那边。RL 只覆盖 50 个域内任务,域外增益是旁路观察。外部基准里 RISE-Video 只从 62.83 到 66.18,摘要里「常超 20 个百分点」说的是涨得多的那几项。开源模型普遍 LoRA 训一轮,商业模型没在同一数据上微调,表里的开源闭源对比不能读成能力天花板。

术语

原文与代码

社区讨论

相关论文

全部论文解读