Apple 提出 IVT:模型学会「预见未来」却不画出来,推理快约 5 倍
jiqizhixin · x · 2026-09-12
Apple 提出 Internalized Visual Thinking (IVT),解决视觉思维链的延迟痛点。
- 问题:视觉 CoT 需要在推理时生成未来帧、再解码重编码,延迟显著;对主动视频推理而言,「事件发生后才到达的正确预测」几乎无价值。
- 思路:既然未来视觉信息的真正价值在于教会模型世界如何变化,那推理时就无需真的「画出」未来。
- 做法:训练时让模型同时学习文本答案与未来帧的隐空间表征;推理时整个未来视觉预测管线被移除,模型直接从当前观测视频作答。
- 结果:在 Ego-Exo4D、Ego4D 等 6 个数据集-任务设置上取得提升,推理速度约提升 5 倍。
「多模态」频道最新
- 用 GPT-6 与生成工具做游戏:蝎子骨骼动画被一键搞定 — Vjeux · 2026-09-12
- 开发者用 GPT-Live-1 API 语音实时生成游戏世界,可凭空造物 — TheMoonMidas · 2026-09-12
- YuE2 音乐生成初体验:ComfyUI 工作流上手分享 — Lividmusic1 · 2026-09-12
- 作者用 MiniMax H3 产出其最长 AI 惊悚短片,配图已获好评 — Domskidan1987 · 2026-09-12
- AI 短片对决:L Kang 对阵 Ryu 的格斗短片亮相 — Ok-Vegetable-2455 · 2026-09-12
- 求推荐视频转视频方案:类似 EbSynth 的免提示词风格迁移 — Expensive-Bus-5473 · 2026-09-12