苹果提出内化视觉思考:推理免生成未来帧,快5倍全面超VisualCoT

机器之心 · wechat · 2026-09-03

Apple 研究团队提出 Internalized Visual Thinking(IVT),针对主动视频推理任务中 VisualCoT 的成本问题给出新范式:训练时预测未来,推理时不再生成未来。

问题与动机

方法

结果

局限:更长时程(hop=3)anticipation 未见收益,多分支未来也让评测困难;IVT 更像在显式 VisualCoT 与纯文本推理之间打开了一个「训练时思考、推理时直答」的新设计空间。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →