冻结VLM外挂Whisper,56项评测上语音omni不必重训骨干

Training-Free Speech-Centric Omni Understanding with Frozen VLMs

Ankan Deria, Hanoona Rasheed, Xilin He, Fahad Shahbaz Khan, Salman Khan

eess.AS, cs.CV, cs.SD

2026-08-08

TFO用Whisper抽出带时间戳、过置信阈值的转写喂给冻结VLM,不改结构。56项、21种语言的配对比较里,语音任务与原生omni持平或更好,视觉与推理多数保住。

这篇在解决什么

原生 omni 模型的做法是给 VLM 加专用音频编码器,再做一轮昂贵的音频-视频-文本对齐。骨干一换,音频通路就要重训,已有的视觉、推理、领域能力还可能被对齐冲掉。音频又密、又吵,还要和画面里的事件对齐,原生训练经常听不见该听的、或从画面脑补出声音。

真正缺的对照是:每个新 VLM 都必须原生 omni 训练吗?语音为主的能力能不能在冻结骨干上外挂进去?哪些任务仍然需要更富的声学表征?

方法

TFO(Training-Free Omni)是即插即用框架,把冻结 VLM 变成语音中心的 omni 系统,不改结构、不更新参数、不做多模态重对齐。音频走语言,视觉通路原样保留。

Whisper 在 VLM 外面把音频切成片段,每段带转写、语种、起止时间和置信度。只保留置信度 ≥ 0.65 的片段;一段都过不了就省略音频上下文,避免把静音和幻觉转写喂进去。需要时序推理时,时间戳留在 prompt 里,让口播和画面事件对上。融合就是把过滤后的转写接到原有语言接口,和系统指令、视觉输入、用户问题放在一起。可选的语音回复用 CosyVoice3 把文本读出来,不参与任何评测音频的构造。

假设很窄:很多音视频任务里,语音主要提供语言证据,VLM 已经会做语言条件下的视觉推理。TFO 测的是这条假设能走多远。

结果

配对比较覆盖四个家族、五个设置:Qwen2.5 的 3B/7B、MiniCPM4.5、NVILA/OmniVinci、Qwen3-30B-A3B,一共 56 项基准、CoVoST2 的 21 种语言。

音视频 9 项平均:Qwen2.5-3B 从 43.2 到 46.2(+3.0),7B 从 45.8 到 48.0(+2.2),VILA +0.4;MiniCPM4.5 −2.2,Qwen3 −0.8。涨幅最大的是要口播对齐画面的任务,Qwen2.5-7B 的 WorldSense +14.5。纯音频 9 项五个设置平均全涨(+1.5 / +1.4 / +4.0 / +13.5 / +1.4),VILA 从 50.3 到 63.8,VoiceBench 上 VILA +51.3。CoVoST2 平均分别 +7.9 / +13.5 / +18.4 / +11.1 / +6.8,MiniCPM4.5 从 45.6 到 64.0。MMAR-Bench 五个变体都掉 1.5–9.5,音乐和环境声是转写路由的盲区。

冻结也保住了骨干。图像平均五个设置全高(+1.8 到 +2.4),视频四个设置高 +2.3 到 +3.8。代码三项 TFO 全胜对应 omni;医学 12 项平均全涨(+0.5 到 +1.7)。AVHBench 把界画清楚:要核验声音是否真的在音频里,TFO 明显弱;要核验音频暗示的物体是否在画面里,TFO 四个家族全胜,因为视觉通路没被动过。

消融上,裸 VLM 已经能打 WorldSense 和 Video-Holmes;加上 Whisper 六项里五项超过 Qwen2.5-Omni-3B;去掉时间戳,AVUT-Gemini 和 Daily-Omni 掉 2.3 和 1.4。

为什么重要

对新 VLM 不必先做一轮骨干绑定的音频对齐,也能拿到能用的语音 omni。训练成本换成推理成本:AVMeme 上总延迟从原生约 0.7–2.4 秒升到 1.3–3.1 秒,同一段音视频多问几次可以摊掉 Whisper。多语增益说明强 ASR 前端能把语种覆盖直接转给冻结 VLM。

这不是「omni 训练可以停」。非语音声学、情绪和音画匹配仍然要声学表征。TFO 的定位是对照基线和工程捷径:语音为主时先外挂,声学很难时再训专用通路,同时盯住骨干有没有被对齐冲掉。

局限与存疑

表征上限写在方法里:转写丢了音色、环境声、音乐结构。往 prompt 里追加 MELLOW、SenseVoice 的文本预测,相对纯 Whisper 没有稳定增益,声学证据很难靠「再写成字」找回来。Whisper 串行增加延迟,实时全双工不在范围内。配对比较绑在现有 omni 检查点上,没有证明换别的 ASR 或别的融合格式会怎样。MiniCPM4.5 和 Qwen3 的音视频平均略低于原生 omni,语言路由不是处处占优。

术语

原文与代码

相关论文

全部论文解读