苹果提出内化视觉思考:推理免生成未来帧,快5倍全面超VisualCoT
机器之心 · wechat · 2026-09-03
Apple 研究团队提出 Internalized Visual Thinking(IVT),针对主动视频推理任务中 VisualCoT 的成本问题给出新范式:训练时预测未来,推理时不再生成未来。
问题与动机
- 在 Early-event / Next-event Prediction 中,显式 VisualCoT 平均推理延迟从约 1.1-1.3 秒暴涨到 6.5 秒以上,且精度提升不稳定;而 Oracle 实验证明真实未来帧信息确实有价值(ROUGE-L 34.4→41.9),瓶颈在像素级生成既贵又易出错。
方法
- IVT 在后训练阶段同时学习文本答案与未来帧的隐空间表征(Next-Embedding Prediction),迫使模型从当前观测中捕捉运动趋势、状态变化与交互意图;推理时移除未来预测分支,直接根据当前视频作答。
- 关键发现:未来表征选 Flux-VAE 效果最好(保留细粒度空间结构);未来预测与语言任务须联合训练,两阶段反而更差;预测 horizon 不宜过长,短期未来监督信号最可靠。
结果
- 在 Ego-Exo4D、Ego4D、EPIC-KITCHENS-100 的 6 个 dataset-task 设置上全部超过 Answer-Only SFT,4 个超过 VisualCoT。
- 平均推理 1.22 秒/样本,与 SFT(1.20 秒)几乎持平,相比 VisualCoT(6.56 秒)约 5 倍加速。
局限:更长时程(hop=3)anticipation 未见收益,多分支未来也让评测困难;IVT 更像在显式 VisualCoT 与纯文本推理之间打开了一个「训练时思考、推理时直答」的新设计空间。
「研究」频道最新
- 33.3% ImageNet 图片含多个类别,研究者称答案集本身不完整 — RexDouglass · 2026-09-03
- ImageNet 约 12% 验证集标签是错的,标注标准从未跟上需求 — RexDouglass · 2026-09-03
- 逆向思维:简化ViT实现立体3D重建SOTA,NBS模型发布 — RexDouglass · 2026-09-03
- Wasserstein 重心重构语言模型嵌入,预测同业错配惩罚更准 — uct · 2026-09-03
- Debias-SparseGPT:在剪枝稀疏化中嵌入去偏,降低大模型人口偏差 — Irina Proskurina · 2026-09-03
- 无需跨资产协方差:语言模型嵌入给出组合方差可计算上界 — uct · 2026-09-03