LoHi 框架:低分辨率稠密采样让长视频理解准确率提升 10.6 个百分点
jchoi2012 · hf · 2026-10-06
- 论文重新审视 VLM 长视频理解的效率问题:逐帧分辨率可以换取更稠密的时间覆盖,而前端解码延迟取决于候选池大小而非最终 token 预算。
- 三个实证发现:同等 token 预算下,低分辨率稠密采样优于原生分辨率稀疏采样;分辨率敏感任务受益于少量高分辨率帧;对小时级视频,前端解码占主导墙钟时间。
- 提出 LoHi:免训练、单次前向,结合稠密低分辨率视频流与稀疏高分辨率图像帧;LoHi-Anchor 用编解码 I 帧元数据选高分辨率帧,LoHi-SemDiv 基于 query 相关性与 CLIP 视觉多样性选择。
- 结果:三个长视频基准上,同 token 预算下比原生分辨率基线平均提升 10.6 个百分点,比最强此前效率方法提升 5.2 个百分点;小时级视频前端解码延迟最高降低 7 倍。
「研究」频道最新
- tszzl:对齐要成为工程学科,起码得先攻克机制可解释性 — tszzl · 2026-10-06
- 因果决策研究亮相可信 AI 研讨会,录像已公开 — murat_kocaoglu_ · 2026-10-06
- Claude 突破 3SUM 复杂度下界,给出 O(n^1.9992) 算法附 Lean 证明 — thegautamkamath · 2026-10-06
- ReSteer 开源:修复 VLA 执行中途无视新指令的可控性缺陷 — siddkaramcheti · 2026-10-06
- 研究者携「推理模型潜空间策略状态」解读工作参加 COLM — hunarbatra · 2026-10-06
- COLM 2026 论文:推理微调会在 LLM 潜空间中留下持久策略状态 — hunarbatra · 2026-10-06