新论文提出 IVT 方法:视频推理降本 5 倍,性能超越 Visual CoT

koustuvsinha · x · 2026-08-19

论文《Beyond Visual CoT》提出了一种名为“内部化视觉思考”的新方法。不同于显式生成中间图像的 Visual CoT,IVT 在训练时让模型预测未来帧的潜在表示,推理时则直接生成答案。实验显示,IVT 在六个数据集任务中超越了 Visual CoT 的性能,同时将平均推理延迟从 6.56 秒降至 1.22 秒,成本降低超过 5 倍。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →