视觉Token暴减百倍:AutoGaze实现长视频高效理解
Cohere_Labs · x · 2026-08-06
Cohere Labs 开源科学社区宣布将于下周举办线上技术分享会,主题为 AutoGaze。
该研究由 Physical Intelligence 研究员、UC Berkeley 博士 Baifeng Shi 主讲。其核心在于解决多模态大模型(MLLM)在处理长视频、高分辨率视频时面临的算力与冗余问题。
- 技术亮点:AutoGaze 作为一种轻量级模块,能在 ViT 或 MLLM 处理前,通过强化学习与下一 token 预测,自回归地筛选出最少的多尺度图像 patch。
- 性能突破:可将视觉 token 数量大幅减少 4 至 100 倍,ViT 和 MLLM 推理速度提升最高 19 倍,使模型能处理 1000 帧 4K 分辨率视频。
- 评测表现:在 VideoMME 基准上取得 67.0% 的成绩;同时发布了首个 5 分钟 4K 分辨率的高清长视频 QA 基准 HLVid,模型表现超越基线 10.1%。
「研究」频道最新
- Flux 3 核心技术 Self-Flow 论文解读:打破外部对齐瓶颈 — linoy_tsaban · 2026-08-06
- ARC评测被批脱离实际:拒绝承认工具调用致其错失AI趋势 — scaling01 · 2026-08-06
- 《可微编程基础》发布重大更新:涵盖端到端自动微分与概率视角 — mblondel_ml · 2026-08-06
- SIGGRAPH 2025 演讲:用视频模型实现生成式重摄影 — CSProfKGD · 2026-08-06
- 消除 AI 垃圾输出:主观领域的数据质量远胜于数量 — _ScottCondron · 2026-08-06
- NeurIPS 2026 征稿:第二届具身空间推理研讨会 — hunarbatra · 2026-08-06