Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt
cs.CV, cs.AI, cs.CL, cs.LG, cs.MM
2026-08-17
Apple 的 IVT 在训练时联合预测未来帧的潜表示与文本答案,推理时直接作答,6 个评测设置全胜纯文本微调,平均延迟比 Visual CoT 低 5.4 倍。
主动式视频推理要求模型在事件结束前就开口:早事件预测(EEP,动作只看到 10%70% 就说出它在干什么)和下一事件预测(NEP,动作还没开始就预告下一步)。预测晚一步,答案就一文不值,所以这类任务对延迟的敏感度和对准确率一样高。
现有两条路都不理想。纯文本微调(Answer-Only SFT)从观察到答案直来直去,从没显式建模过未来。Visual CoT(视觉思维链)先让模型生成一张「未来帧」,再基于这张图作答,思路直观,但生成一张图要逐 token 解码视觉表征,还要把图重新编码回模型,实测平均延迟从 1.20 秒涨到 6.56 秒,涨了 5.5 倍。
论文先做了一个诊断实验:把 Visual CoT 里模型自己生成的未来帧换成真实未来帧(oracle 上界)。早事件预测的 ROUGE-L 立刻提升 21.6%,说明未来视觉信息本身很有价值;可模型自己画的帧只带来 5.9%,在下一事件预测上甚至是负收益。瓶颈不在「想未来」,在「把未来画成像素」这一步的成本与失真。
IVT(Internalized Visual Thinking)的思路一句话讲完:训练时想未来,推理时直接答。
底座是 BAGEL-7B(Apple 的统一理解/生成模型,Mixture-of-Transformers 架构,合计约 14B 参数),训练 2 万步。论文真正的分量在系统消融,六个设计维度各拿到明确结论:预测什么(Flux-VAE latent、DINOv2、SigLIP2 可学习/冻结)、用什么解码器(参数共享的 Dense,还是按 token 类型分专家的 MoE)、预测多远(H=14)、数据配比(理解:预测 = 1:1/3:1/5:1)、课程(联合训练 vs 两阶段)、损失(直接回归 vs rectified flow matching)。
三个数据集(Ego-Exo4D、Ego4D、EPIC-KITCHENS-100)× 两个任务共六个设置,IVT 相对纯文本 SFT 在四个指标上全面提升。与 Visual CoT 的对照(同底座、同训练数据,ROUGE-L):
| 设置 | Answer-Only SFT | Visual CoT | IVT 最优 | 胜者 |
| Ego-Exo4D 早事件 | 28.8 | 32.7 | 33.3(MoE) | IVT |
| Ego4D 早事件 | 33.3 | 36.1 | 34.8(Dense) | Visual CoT(+1.3) |
| EPIC 早事件 | 36.5 | 40.2 | 39.0 | Visual CoT(+1.2) |
| Ego-Exo4D 下一事件 | 46.3 | 42.6 | 48.5(MoE) | IVT |
| Ego4D 下一事件 | 51.9 | 52.2 | 52.7(Dense) | IVT |
| EPIC 下一事件 | 45.5 | 42.8 | 49.1(MoE) | IVT |
Visual CoT 在两个早事件设置上还领先 1.21.3 分,但三个下一事件设置全输;按三个基准平均,IVT(Dense)把下一事件 ROUGE-L 从 45.9 拉到 49.7。用 Qwen3-VL-30B 蒸馏的 Text-CoT 普遍比纯 SFT 还差,EPIC 下一事件上 32.3 对 45.5,塌得最狠。
延迟是结构性优势:单张 B200、batch 1,Visual CoT 平均 6.56 秒/样本,P95 达 7.92 秒;IVT 平均 1.22 秒、P95 1.77 秒,和纯 SFT 的 1.20 秒/1.92 秒几乎重合。
域外迁移上,Charades 在训练中完全 held-out:纯 SFT 71.7% 准确率,Visual CoT 掉到 58.2%,IVT(Dense)反而最高,73.2%。
消融里最反直觉的一条:两阶段训练(先 1 万步未来预测、再纯任务微调)比完全不做预测训练还差,ROUGE-L 30.6 跌到 28.6(−6.5%);联合训练做到 34.5(+12.6%)。预测监督必须和文本目标持续耦合,拆成先后两段,学到的表征会在任务微调阶段丢掉。其余结论:Flux-VAE latent 是最强目标,DINOv2 这类语义特征也有收益但更小;1:1 配比在 2 万步时全面领先,3:1 和 5:1 早期涨得快、后期平台化;Dense 解码器在短视野最强,H=2 时 37.4 对 MoE 的 33.8,MoE 对视野更钝、峰值在 H=3。
对做流式或主动视觉系统的团队(眼镜助手、机器人、监控),这是一条可复制的路径:把视觉前瞻从推理成本转成训练成本,推理计算图一个字节都不用改,部署侧零改动,收益全部来自后训练。对统一理解/生成模型这个方向,它给「生成分支到底有什么用」提供了一个干净回答:生成能力的收益未必来自画出高质量的图,可以来自学会预测未来的表征。
这也是一篇少见的把失败配方写清楚的论文。六个设计维度各自的敏感度都有数据,照着配置抄能避开两阶段这类看起来合理的坑。