OmniDelta 用技能驱动分配压缩多模态 token
Haoyang Huang · hf · 2026-07-29
OmniDelta 用技能驱动重分配多模态 token 预算
OmniDelta 是一个训练无关的多模态 token 压缩框架,目标不是只做“删 token”,而是先解决预算该分给音频还是视频、以及各自内部该怎么分的问题。作者认为,直接用查询和音视频 token 的相似度来做跨模态预算分配并不可靠,而固定的模态内均匀预算也容易漏掉关键信息、保留冗余内容。
方法
- 先构建音频技能池和视频技能池,根据查询意图动态调整保留预算。
- 再结合局部复杂度和时间冗余,在音频片段与视频帧之间重分配预算。
- 该方法可以和现有 pruning 策略叠加,在不改变总保留比例的前提下,改变预算花在哪里。
结果
- 在 4 个音视频 benchmark 和 2 个 Qwen2.5-Omni 模型上验证。
- 在不同剪枝比例下,取得新的准确率-效率 Pareto 前沿。
- 在 Qwen2.5-Omni-7B 上保留 25% token 时,GPU 显存下降 22.0%,端到端推理速度提升 1.64 倍。
「多模态」频道最新
- 音乐超分 LLM:是否存在类似视频超分的音频增强模型? — LeatherRub7248 · 2026-08-24
- 描述梦境给AI龙,它即生成星球带你体验 — repligate · 2026-08-24
- 用金缮纹理修复3D模型编辑后的裂缝 — repligate · 2026-08-24
- 用 FL2VA 模型制作汉尼拔角色视频 — Nimblecloud13 · 2026-08-24
- MiniMax H3 助力复活中世纪短视频创作,工作流全公开 — zanatas · 2026-08-24
- NAPE 音频预训练法开源:无解码器 SOTA — kastnerkyle · 2026-08-24