AutoGaze 减少视觉 token 4~100 倍,实现 4K 视频高效理解

Cohere · youtube · 2026-08-15

AutoGaze 是一个轻量级模块,旨在解决多模态大语言模型(MLLM)处理长高清视频时的像素冗余问题。它在视频送入视觉 Transformer(ViT)或 MLLM 之前,通过自回归方式选择能重建视频的最小多尺度图块集,从而消除冗余。

主要成果:

该研究由 Physical Intelligence 研究员 Baifeng Shi(UC Berkeley 博士)提出。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →