LEAP 分块检索证据,让小时级音视频问答性能提升最高 16.8%
Juyi Lin · hf · 2026-10-01
LEAP 解决小时级音视频问答的上下文困境:全量编码撑爆上下文,均匀压缩又稀释细粒度证据。
方法:将录音切成固定时长块,用轻量定位步骤为候选窗口打分;最高分窗口池化后在一次有界的回答步骤中重编码,使答案输入与峰值上下文与录音时长无关。定位与推理解耦——定位可在预计算转写上进行而无需解码媒体帧,最终回答再路由到原始音视频流以保留细粒度视觉与非语音证据。两阶段均训练 LoRA(定位 LoRA 与回答 LoRA),块结构天然支持因果查询,无需流式专项训练即可流式推理。
结果:在多个 AVQA 基准上超越 Qwen3-Omni-30B-A3B 基线 4.5-16.8%;迁移到 MiniCPM-o 4.5 亦超其公开结果 3.1-13.0%。
「多模态」频道最新
- Seeddance 2.5 打造 3D 博物馆盗窃动画场景,附 prompt — azed_ai · 2026-10-01
- 360 度环绕 LoRA 配 MiniMax 首尾帧,冻结瞬间效果惊艳 — AndrewJumpen · 2026-10-01
- 谷歌 AI 将 500 年亚洲古诗《春梦》改编成电影级短片 — hansori_kr · 2026-10-01
- Nvidia 开源 Lyra 2.0:任意图片一秒变成可探索的 3D 世界 — CurieuxExplorer · 2026-10-01
- Pinhole:基于 stable-diffusion.cpp 的一键式全本地图像生成器开源 — Pamidoraa · 2026-10-01
- 用 Nano Banana Pro + h3 做短片的工作流分享,求 LTX 2.5 对应方案 — No_Reference_7678 · 2026-10-01