OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models
Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding
cs.CV
2026-08-04
OmniPack 给全能多模态模型做免训练 token 压缩(分进 LLM 前与 LLM 内两阶段);Qwen2.5-Omni-7B 上留 15% token 保 95.6% 性能,FLOPs 降到一成。
全能多模态模型(Omni-LLM,像 Qwen2.5-Omni、GPT-4o 这类同时建模视觉加音频加文本的)很强,但密集的音视频 token 带来巨大的算力和显存开销。已有的 token 压缩在低预算下掉点严重:进 LLM 之前压,容易把结构上重要、全局分散的证据丢掉;进 LLM 内部压,又没充分利用查询条件下的音视频协同。OmniPack 就是冲这两段各自的短板去的。
OmniPack 免训练,分两阶段:
超参上,7B 和 MiniCPM-o 在第 18 层做内部压缩,3B 在第 26 层;(ηv,ηa)=(0.25,0.35),λ=0.20,(τv,τa)=(0.10,0.05),ζ=0.10,论文给了敏感性分析说明鲁棒。
在 Qwen2.5-Omni-7B 上跨五个基准(AVUT、WorldSense、DailyOmni、VideoMME、LVOmniBench):
| token 保留 | 性能保留 | FLOPs |
| 25%(仅进 LLM 前) | 98.2% | 4.9 倍降低 |
| 15%/7.5% | 95.6% | 10.0% 原 FLOPs,前处理提速 4.5 倍 |
| 10%/5% | 92.9% | 6.8% 原 FLOPs |
全面超过 SEATS(两种变体)、OmniSIFT、OmniZip、VisionZip-om、FastV-om。换骨架也成立:Qwen2.5-Omni-3B 在 15%/7.5% 保 92.7%(9.0% FLOPs);MiniCPM-o-2.6 保 100.8%(10.0% FLOPs,反而略超原模型)。消融里覆盖选择在 WorldSense 和 LVOmniBench 上单模块最强,三个组件互补,音视频协同比各自独立压更好,第 18 层最优。
对要部署全能多模态模型的团队,这是条免训练、即插即用的省算力路径,10 倍 FLOPs 降低对长音视频输入尤其值钱。合并而非丢弃、进 LLM 前后两段各管一类冗余这两个思路可迁移到别的多模态架构。MiniCPM-o 上性能反超说明压缩顺带起到了去噪正则化的作用,这是个额外的收获。
论文没有专门局限章节。几处存疑:FLOPs 指标只算了视觉加音频 token 在 transformer 里的部分,排除了编码器、投影器、文本和输出头,端到端实际提速没那么夸张;MiniCPM-o 反超 100.8% 意味着压缩当成了正则化,但这是否在所有任务上都稳定受益没说清;超参是调过的,虽然有敏感性分析;基准侧重音视频理解,生成类任务上效果如何没覆盖。