新论文提出 IVT 方法:视频推理降本 5 倍,性能超越 Visual CoT
koustuvsinha · x · 2026-08-19
论文《Beyond Visual CoT》提出了一种名为“内部化视觉思考”的新方法。不同于显式生成中间图像的 Visual CoT,IVT 在训练时让模型预测未来帧的潜在表示,推理时则直接生成答案。实验显示,IVT 在六个数据集任务中超越了 Visual CoT 的性能,同时将平均推理延迟从 6.56 秒降至 1.22 秒,成本降低超过 5 倍。
「研究」频道最新
- CoRL 2026 将举办持续自改进机器人研讨会 — chris_j_paxton · 2026-08-19
- NVIDIA 新论文:RGBX-Next 用扩散模型当渲染器,被猜是 DLSS 5 — ssh4net · 2026-08-19
- 语言学奥赛首次引入 AI 挑战赛,Opus 达金牌水平 — Cohere_Labs · 2026-08-19
- Opus 4.8 驾驶开源工具设计蛋白,能力逼近专家 — heypearlai · 2026-08-19
- Nvidia GPU 利用率误导大?A100 实测指令发射率不足一半 — tokenbender · 2026-08-19
- Rényi 熵估算样本复杂度研究获紧确界限 — abeirami · 2026-08-19