LEAP 分块检索证据,让小时级音视频问答性能提升最高 16.8%

Juyi Lin · hf · 2026-10-01

LEAP 解决小时级音视频问答的上下文困境:全量编码撑爆上下文,均匀压缩又稀释细粒度证据。

方法:将录音切成固定时长块,用轻量定位步骤为候选窗口打分;最高分窗口池化后在一次有界的回答步骤中重编码,使答案输入与峰值上下文与录音时长无关。定位与推理解耦——定位可在预计算转写上进行而无需解码媒体帧,最终回答再路由到原始音视频流以保留细粒度视觉与非语音证据。两阶段均训练 LoRA(定位 LoRA 与回答 LoRA),块结构天然支持因果查询,无需流式专项训练即可流式推理。

结果:在多个 AVQA 基准上超越 Qwen3-Omni-30B-A3B 基线 4.5-16.8%;迁移到 MiniCPM-o 4.5 亦超其公开结果 3.1-13.0%。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →