OmniScope: 全模态大模型无损 token 压缩框架
Jinsen Su · hf · 2026-08-01
OmniScope 提出了一种无需训练的全模态大模型 token 压缩框架,专门解决现有方法在跨模态(如音视频)相关性峰值不匹配时容易丢失关键线索的问题。
核心机制:
- 模态解耦:将 query 作为共享语义锚点,但为音频和视频分别计算相关性并分配独立的 token 预算。
- 视觉修剪:采用 anchor-delta 策略保留全局上下文与时序变化。
- 音频合并:在每秒内合并音频 token 以减少冗余,同时保持时序连续性。
实验效果: 在 4 个音视频基准测试及两种规模的 Qwen2.5-Omni 模型上,该框架在所有压缩设置下均取得最佳平均准确率。在仅保留 25% token 的情况下,实现了高达 3.53 倍的 prefill 加速和超 15% 的 GPU 内存节省,而平均准确率仅下降 0.35 个百分点。
「Infra」频道最新
- 黄仁勋反驳GPU堪比核弹论:应让所有人拥有AI — rohanpaul_ai · 2026-08-01
- DeepSeek-V4-Flash 推理受阻:vLLM 暂不支持新 confidence_head — teortaxesTex · 2026-08-01
- AMD 开源 Mi455/CDNA5 GPU 指令集架构 — AnushElangovan · 2026-08-01
- 月之暗面 MoonEP 致谢阿里 AcclEP,但该库无任何公开源码 — giffmana · 2026-08-01
- AMD 集显跑大模型实测:MoE 架构在端侧推理性能碾压 — tabletuser_blogspot · 2026-08-01
- 超大规模云厂商的隐忧:AI 硬件折旧周期远长于实际淘汰速度 — ai · 2026-08-01