VBVR-Pro:300 项任务训练视频模型在图像中直接推理
TheTuringPost · x · 2026-09-29
一批研究者提出 VBVR-Pro,一套面向「原生视觉推理」的 300 项任务基准与训练集,让模型用图像和视频作为推理过程的一部分,边画边推。
- 对比了 30+ 模型,含 125 万训练样本,50 类任务留作外部测试;目标是视频模型的「Verification Age」:给模型可验证结果的任务,用规则化奖励做强化学习。
- 规则奖励把分数从 0.470 提到 0.548,优于 VLM 奖励的 0.508。
- 消融显示中间图像关键:去掉中间文本分数从 0.638 降至 0.533,去掉图像则暴跌至 0.099。
- 训练后的 Wan2.2-I2V-A14B 外部基准大幅提升:V-ReasonBench 10.21→38.22、VideoThinkBench 25.71→52.86、RULER-Bench 57.89→66.96;视频生成在持续追踪物体随时间变化的任务上最强,图文交替的推理还更省算力。
所属事件:52 位学者发布 VBVR-Pro 原生视觉推理基准(2 条相关)→
「多模态」频道最新
- QuiverAI Arrow 2 Telos 以 1624 Elo 首破 SVG 生成排行榜 1600 分 — stuffyokodraws · 2026-09-29
- 8GB 显存 5060 上跑 FLUX.1 LoRA 训练的可行性求证 — Wide_Director_8897 · 2026-09-29
- Flatbed 发布:每个资产可单独提示的 AI 原生视频编辑器 — rchardkovacs · 2026-09-29
- 一张图变成可走动世界:Hyper3D+GPT-6 重建3D场景 — Scobleizer · 2026-09-29
- 光场基元新方法:用可微基元替代稠密光线库,实时渲染新视角 — zhenjun_zhao · 2026-09-29
- 换脸/换头工作流 v2.0 更新,附完整视频教程 — feroszy · 2026-09-29