在隐空间重建画面终态做多步时间推理,Vbvr-VQA 准确率 74.8%

ChronoVision: Temporal Reasoning via Latent State Reconstruction

Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

cs.CV

2026-08-06

ChronoVision 让多模态模型在排序打乱的视频帧前先在隐空间预测最终画面的表征,配合 ROI 注意力与 GRPO 强化,在自建 Vbvr-VQA 上达 74.8%,超过 Claude Opus 4.6。

这篇在解决什么

多模态大模型认静态图很准,但碰到「物体转几度后落到哪一格」「小球连弹五次后的轨迹」这类需要多步推演的任务就垮。作者认为瓶颈在语言:链式推理全在文本里跑,而三维旋转、连续物理运动这种东西,用文字描述必然丢空间信息。

他们还指出评测本身有漏洞。常见的选择题格式里,选项文字本身就有歧义,模型靠语义匹配就能蒙对,根本不用看图;选一个最终答案也测不出它是否真懂时间序列的演化。

于是他们做两件事:造一个堵住语言捷径的新基准,再训练一个能「脑补」终态画面的模型。

方法

ChronoVision 建立在 Qwen3.5-9B 上,训练分两个阶段。

监督微调阶段插入两个模块。重建视觉头(Reconstructive Visual Head)让模型用打乱候选帧里的零散信息,去预测最终那一帧的隐空间表征,用均方误差监督。这逼着模型把「结果长什么样」内部化,而不是只输出一个排序。兴趣区注意力定位(ROI Attention Locating)则在指定中间层把注意力收束到变换发生的区域,用注意力凝聚损失把权重压到标注的边界框内,过滤掉与推理无关的背景语义噪声。

第二阶段是基于 GRPO 的强化学习,作者叫它隐式过程 grounding。奖励分三块:结果奖励看排序是否完全命中,隐式对齐奖励量度每一步推理意图与候选视觉特征的余弦相似度,视觉聚焦奖励用自注意力的香农熵防止注意力塌缩。三者都归一化到 0 到 1,无需人工标注。

配套的 Vbvr-VQA 基准把视频推理改造成严格图像排序:给一帧初始画面和六帧打乱的候选帧,模型要排出正确时间序。这去掉了文字作答的空间,模型没法再靠选项文本蒙。

结果

Vbvr-VQA 上 ChronoVision 总体 73.2%、域内 74.8%、域外 71.6%。

模型总体准确率
Qwen3.5-9B(基座)14.2
GPT-5.433.8
Gemini 3.1 Pro41.8
GPT o346.0
Qwen3.5-397B49.4
Claude Opus 4.655.8
ChronoVision73.2

跨域的 IntPhys2(真实物理事件排序)上拿到 55.0%,比基座 Qwen3.5-9B 的 48.5% 高 6.5 个点,简单子集高 11.5 个点。两个真实视频推理基准 Video-Holmes、LongVideo-Reason 分别是 45.89 和 74.7。消融里重建视觉头单独贡献约 +3.2 个点,ROI 模块 +1.2,强化阶段再 +3.2;三个奖励项缺一不可,去掉结果奖励掉得最多。

通用视觉语言基准几乎没动:MMMU 从 78.4 到 78.8,其它几项也基本持平。这说明这是一项专门加上的能力,不是整体智力提升。

为什么重要

把「在脑子里模拟画面演化」这件事从认知科学搬进了训练目标,用隐空间重建替代语言描述,思路干净。ROI 注意力和过程奖励的设计也都紧扣「视觉证据」这个目标。

但要看清一个事实:74.8 这个数字主要来自作者自建的基准,而且 Frontier 模型是零样本去跑一个它们从没见过的新格式,而 ChronoVision 是专门为这个任务训练的。差距有一部分反映的是格式陌生度,不全是能力差。通用基准纹丝不动也印证了它是窄能力增强。

局限与存疑

最大的问题是评测自循环:Vbvr-VQA 是作者自己造的,任务格式也是他们设计的,自家模型大幅领先这种结果需要更多第三方复现才能站稳。IntPhys2 是现成的、更有说服力,但那里的提升(6.5 个点)比自建基准上的提升(领先近 18 个点)小得多,更接近真实水平。

通用视觉语言能力没涨,说明这套方法目前是针对时间排序任务的专用件,能不能迁移到其它视觉认知任务没验证。基座是 Qwen3.5-9B,文中未给训练数据规模和算力开销。

术语

原文与代码

相关论文

全部论文解读