浅层5层建索引,流式视频问答预填延迟最高降52.1倍

ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding

Jitai Hao, Ke Yang, Qiang Huang, Jun Yu

cs.CV, cs.CL

2026-09-03

流式阶段只用浅层KV建索引,提问时再对检索证据做全深度推理。OVO-Bench与最强方法持平,单帧预填与10秒端到端延迟最高分别降52.1倍和11.9倍。

这篇在解决什么

流式视频理解的负载是不对称的:帧一直来,问题偶尔才来。ReKV、HERMES、InfiniPot-V 这类 KV 方案,在还不知道未来会问什么的时候,就把每一帧过完整个语言模型。后面再压缩缓存,算力已经花掉了,还堆出一份可能永远不会被 attend 的深层 KV。

查询无关的合并和驱逐,可能把回溯题需要的那一帧扔掉。整段历史都塞进上下文,又会拖慢回答、干扰当前场景。OASIS、WeaveTime 按需翻历史,往往要先跑一轮回答级推理才能决定翻不翻。真正被忽略的维度是模型深度。

哈工深(深圳)在 LVBench 上测到一个很具体的现象:Qwen3-VL-8B 共 28 层,第 4 层已经能把问题相关的历史片段找出来;LLaVA-OneVision-7B 共 32 层,第 3 层同样够用。检索用浅层就行,全深度应该留给真正要回答的那几段证据。

方法

ShallowStream 把「一直在跑的流处理」和「偶尔发生的回答」拆开,不训练,直接改预训练 MLLM 的推理路径。

流处理阶段,每个视频单元只过浅层 [0, P)。落地配置里 Qwen3-VL 取 P=5、每单元 2 帧,LLaVA-OV 取 P=4、每单元 1 帧,两端都是 1 FPS。浅层 KV 作为全历史视觉索引放在主机内存,同时保留输入级视觉状态,选中的单元以后可以从第 0 层重新进语言模型,不必存任何全深度 KV。最近若干单元永远当当前场景;更早的历史默认按单元细粒度保存。内存超预算时打开可选的 long-cluster:时序相邻、描述子相似的单元收成簇,KV 做滑动平均,每个簇只留一个代表。

问题到来时走三步。

结果

评测在 OVO-Bench 和 StreamingBench,训练免费。效率测在一块 RTX 5090、Qwen3-VL-8B、5 段长视频。

骨干方法实时感知回溯OVO 总分
Qwen3-VL-8BShallowStream80.958.169.5
Qwen3-VL-8BOASIS78.157.267.7
Qwen3-VL-8BSimpleStream80.252.566.4
LLaVA-OV-7BShallowStream75.449.062.2
LLaVA-OV-7BSimpleStream71.049.660.3

StreamingBench 实时理解子集上,Qwen3-VL 版 78.2,对 HERMES 的 76.6;LLaVA-OV 版 75.5,对 CausalMem 的 74.3。打开 long-cluster 后分数几乎不动(69.2 和 62.3)。

延迟才是这篇要卖的点。相对最重的对照,单帧预填最多降 52.1 倍,每 10 秒来一个问题的端到端延迟最多降 11.9 倍。P=5 时单帧预填 10.72 ms,切到 P=19 升到 15.53 ms,OVO 回溯平均不再涨,P=5 时回溯平均 58.27 已是这组扫描的最高点。80 秒提问间隔下,ShallowStream 约 2.6 秒算力,HERMES 6.2 秒,OASIS 50.4 秒。long-cluster 把 64–1024 帧的峰值 GPU 显存压在约 18 GiB,不压缩会长到 21.76 GiB。门控 92.7 ms、证据选择 106.0 ms,相对整次查询 1.759 秒只占一小块。

检索消融里,token 投票强过 pooled 浅层 Q-K 和独立 SigLIP;再加上 max-min 多样性,避免连续挑到同一类镜头。

为什么重要

流式系统的稳态成本是「每来一帧要花多少」。把预填从全深度砍到前 4–5 层,等于承认大多数帧永远不会被某个未来问题点名。对可穿戴助手、监控预警这类「一直看、偶尔问」的场景,这个不对称值得按系统设计,而不是把离线长视频方法硬套成在线。

方法是训练免费的推理改写,Qwen3-VL-8B 和 LLaVA-OV-7B 都能接。已经在用 ReKV、HERMES 这类全深度 KV 方案的人,可以把它看成更便宜的索引路径:浅层当检索器,深层只打选中的证据。

分数只略高于 OASIS 和 SimpleStream。拉开差距的是算力和延迟,不是新骨干。

局限与存疑

论文标了 Work in Progress,正文没有独立的局限节。

LLaVA-OV 的门控在合成校准集上召回只有 44%,精确率 97.78%。高精度低召回意味着不少回溯题会被当成「看最近就行」。OVO-Bench 上它的回溯平均 49.0,略低于 SimpleStream 的 49.6,实时感知把总分拉了上去。Qwen3-VL 门控召回 97%,这条短板主要绑在较弱骨干上。

52.1 倍是「最多」,对照大头是 OASIS 那种先做回答级推理再决定翻不翻历史的路径。和 HERMES 比,80 秒间隔下是 6.2 秒对 2.6 秒,大约 2.4 倍,不是 50 倍。显存只报峰值 GPU;浅层档案在主机内存,CPU 侧增长没有合并口径。StreamingBench 上 LLaVA-OV 的计数子项只有 35.2,低于 HERMES 的 45.6。

生成上限 16 个新 token,评测是短答。门控阈值来自 200 条合成题,不碰评测集是干净的,合成分布跟真实用户问题差多远没有外部验证。浅层够用只在两个 7B/8B 骨干、有界局部注意力的流式预填设定下测过;更深模型或 dense full-history 注意力下,最佳切割层可能上移。long-cluster 把整簇压成一个代表,细粒度时刻对不齐时会丢证据。

术语

原文与代码

相关论文

全部论文解读