NTU/CMU 等推出 VBVR-Pro:300 项任务构建视觉推理闭环
机器之心 · wechat · 2026-09-20
NTU、CMU、Berkeley 等高校研究者联合推出原生视觉推理套件 VBVR-Pro,论文、数据、模型与代码均已公开。核心内容包括:
- 300 项视觉推理任务,覆盖感知、空间、变换、抽象、知识五类,构建 125 万条训练数据,每条均渲染为视频与图文交错两种模式。训练后的模型在 RISE-Video、V-ReasonBench 等 7 个未见 benchmark 上提升最高超 20 个百分点,显示跨场景泛化。
- 可验证打分器:为 100 项任务实现逐项可解释打分器,与人类判断一致性超 60%,高于 GPT-5.5(0.54)和 Gemini-3.1-Pro(0.52),接近人类一致性上限(约 0.77)。
- 模态对比:30+ 模型同场测试发现,单图适合终态任务,图文交错适合离散状态,视频适合连续变化;移除中间视觉状态性能显著下降,而移除文字影响较小,模型呈现 Chain-of-Step 现象。
- RL 训练:打分器可直接作 Verifiable Reward,Wan2.2-TI2V-5B 基线 0.470,SFT 后 0.503,RLVR 后达 0.548,并提升 OOD 表现,让模型学会在生成中自我修正。
「多模态」频道最新
- 用户实测 Midjourney v8.2 出图:「我的不同面」人像系列 — chrisfirst · 2026-09-20
- RefGarden 一条 prompt 生成 100+ 图像与档案短片,可漫游探索 — round · 2026-09-20
- Qwen Image 2.1 倒计时:10 小时后开源发布 — CeFurkan · 2026-09-20
- Qwen Image 2.1 明日发布,PR 已合入 ComfyUI — fruesome · 2026-09-20
- 剪映发布剪映助手:自然语言描述即可自动剪辑视频 — xiaohu · 2026-09-20
- 实测 LTX Video 2.5:单次生成最长 121 秒,作者推导出分辨率换算公式 — Robotman2100 · 2026-09-20