长视频8帧查询选帧胜过16帧均匀采样6.9分,压缩几乎免费

Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs

Prakhar Khatri

cs.CV, cs.CL

2026-09-03

在受控套件里拆开选帧、压缩、再投资:小时级视频上OMP 8帧比均匀16帧高6.9分,砍半分辨率最多掉0.44,省下的token再买帧还能涨2到3分。

这篇在解决什么

长视频语言模型看不完所有帧。一小时按 1 fps 解码是 3600 张图,系统通常只留 8、32 或 64 帧。哪几帧活下来,常被当成预处理细节。这篇较真:在固定打分器、固定答题模型、固定评测套件里,把选帧、空间压缩、把省下的 token 再投回去三件事拆开测。

公开选择器很难比。AKS、FOCUS、LDDR、Q-Frame 往往同时改打分器、分辨率策略、答题模型和帧数,跨论文的数字比的是两套实验,不是两个想法。这篇把每一项单独拧出来。

方法

实验单元是同一道题答两次,只改一个输入策略,用配对 McNemar 检验。候选池 1 fps,全部用 LongCLIP 编码问题题干(不含选项),六个选择器读同一份缓存。

选择器包括均匀采样、cosine top-k、AKS、FOCUS⋆(用 LongCLIP 重放公开的 clip-bandit 日程,不是原版预算制 ITM)、1993 年的 Orthogonal Matching Pursuit,以及 LDDR 的 stage-1 Linear-DPP。OMP 每一步选与当前残差最相关的帧,再把已选方向从 query 里投影掉,抑制重复。无视频专用零件,无超参可调,所以它跟专用选择器的差距,测的是规则本身,不是调参投入。

压缩把选中的时间戳冻住,把每帧空间预算大约砍半(D@53)。再投资把省下的预算买成 16 帧压缩图,对照 8 帧全分辨率。LongVideoBench 上实测 token 比是 0.996 和 0.984,赢的那一侧还更便宜。主答题模型是 Qwen3-VL-8B,字幕关闭;InternVL3 2B/8B 和 GPT-5-mini 做迁移核对。基准是 LongVideoBench 全集(n=1337,按 15/60/600/3600 秒分层)、Video-MME(n=2700)、LVBench(n=1549)。

结果

选帧是最大杠杆。小时级 LongVideoBench 上,OMP 8 帧准确率 0.5461,均匀 16 帧 0.4770,少一半输入高 6.9 分(p=0.0011)。10 分钟档同样:OMP 16 帧 0.6578 vs 均匀 32 帧 0.6044,+5.3。15 秒短片上均匀、top-k、OMP 完全一样(0.7249),候选池还没大于预算,选择器无事可做。

k=8、Qwen3-VL-8B 的匹配对比:

方法LongVideoBenchVideo-MMELVBench
均匀采样0.56540.56370.3454
top-k0.60280.57040.4319
OMP0.62230.62220.4635
AKS0.59160.60590.4287
FOCUS⋆0.58190.55780.3983
LDDR-select0.63200.61930.4693

OMP 相对均匀采样 +5.69 / +5.85 / +11.81。LDDR-select 是唯一跟得上的,三套基准都在 1 分以内。换 SigLIP 当打分器,600 秒档 OMP 有 67%–84% 的帧被换掉,排序仍是均匀 < top-k < OMP。

压缩几乎白送:三套 Qwen 汇总里,冻住时间戳减半空间预算,准确率最多动 0.44 分。LongVideoBench 长视频池上,90% 区间落在事后选定的 ±3 分等价带里,卡不进 ±2。把省下的预算买成 16 帧,LongVideoBench +2.24、LVBench +3.04(p=0.0009)、Video-MME +1.56。均匀采样上同样方向(+1.13),选择器交互不显著,不能说这必须靠 OMP。

实现事故也写进了正文。AKS 移植时 padding 分支在 k<32 退化成全局 top-k,约 99.5% 的帧选错;纠正后 LVBench 只动 +0.07,LongVideoBench −1.05,Video-MME +2.74。跟 Chen et al. 2026a 同一答题模型、同一预算、同一编码器的 harness,九个可比格子里八个更低,差距 0.07 到 3.74 分,均匀采样地板在 LVBench 上是 28.08 vs 34.54。

为什么重要

工程上的排序很清楚:先把帧选对,分辨率当松弛变量,省下来的 token 买更多时刻,不要揣进口袋。1993 年的 OMP 就能打平专用选择器,新规则至少该在同一套分数上放一个经典 greedy/pursuit 基线。

更刺的结论是评测本身。两个受控 harness 的差距已经覆盖多数公开选择器论文在吹的那点提升。跨论文比「谁高 2 分」基本没有信息量。打分用题干还是题干加选项,又能再挪 2 到 4 分,而且拿错误选项拼出来的 query 也能吃到一半增益,所以这轴测的不一定是相关性。

局限与存疑

FOCUS⋆ 和 LDDR-select 都不是完整系统复现。等价区间的 ±3 分是看完数据后选的,不能当预先登记的等价证明。残差几何只在 LongCLIP 上测过,失败审计是目的抽样,不能外推比例。选择阶段还要 1 fps 解码加全池 LongCLIP,这笔成本没算进答题 token,单 query 部署摊不掉。 InternVL3-8B 在 Video-MME 中长视频上对 OMP 几乎无感(中 +0.33、长 +0.11),同一模型在 LVBench 上却 +10.14,选择收益是答题器–基准对的属性,不是时间戳集合的常数。字幕全程关闭,字幕锚定题对所有视觉选择器都不公平。MDP3 和 Q-Frame 没跑。

术语

原文与代码

相关论文

全部论文解读