OmniScope: 全模态大模型无损 token 压缩框架

Jinsen Su · hf · 2026-08-01

OmniScope 提出了一种无需训练的全模态大模型 token 压缩框架,专门解决现有方法在跨模态(如音视频)相关性峰值不匹配时容易丢失关键线索的问题。

核心机制:

实验效果: 在 4 个音视频基准测试及两种规模的 Qwen2.5-Omni 模型上,该框架在所有压缩设置下均取得最佳平均准确率。在仅保留 25% token 的情况下,实现了高达 3.53 倍的 prefill 加速和超 15% 的 GPU 内存节省,而平均准确率仅下降 0.35 个百分点。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →