AutoGaze 减少视觉 token 4~100 倍,实现 4K 视频高效理解
Cohere · youtube · 2026-08-15
AutoGaze 是一个轻量级模块,旨在解决多模态大语言模型(MLLM)处理长高清视频时的像素冗余问题。它在视频送入视觉 Transformer(ViT)或 MLLM 之前,通过自回归方式选择能重建视频的最小多尺度图块集,从而消除冗余。
主要成果:
- 效率提升: 视觉 token 数量减少 4 倍至 100 倍,ViTs 和 MLLMs 的推理速度提升最高达 19 倍。
- 能力扩展: 使得 MLLM 能够处理 1000 帧 4K 分辨率的视频。
- 性能表现: 在 VideoMME 基准测试中达到 67.0% 的分数;在作者提出的新基准 HLVid(5 分钟 4K 视频 QA)上,基线提升 10.1%。
该研究由 Physical Intelligence 研究员 Baifeng Shi(UC Berkeley 博士)提出。
「研究」频道最新
- Medical SAM3 发布:通用提示驱动的医疗图像分割基础模型 — tom_doerr · 2026-08-15
- LeDXA 模型:用 DEXA 扫描预测糖尿病与衰老 — iScienceLuvr · 2026-08-15
- GRPO 与 OPD 被定义为仅含 Actor 的 PPO 变体 — bronzeagepapi · 2026-08-15
- ReLU 论文作者回顾:解决梯度消失的核心突破 — burkov · 2026-08-15
- 新研究发现记忆可在连接丢失后存留,颠覆传统认知 — mtizard · 2026-08-15
- 四大损失函数对应四种 LLM 失对齐模式 — LessWrong 精选 · 2026-08-15