长视频 MLLM 视觉 token 分配研究:选帧决定上限,省token应换更多帧
Prakhar Khatri · hf · 2026-09-04
该研究对长视频多模态大模型(MLLM)中的视觉 token 分配做了受控实验,核心发现:
- 帧选择主导准确率:选哪些帧进上下文对长视频理解精度的影响最大。
- 空间压缩几乎零成本:只要把空间压缩省下的 token 预算重新投入到更多帧上,空间压缩带来的精度损失几乎可以忽略。
- 评测需要统一基准:不同帧选择方法缺乏公平比较框架,作者提出了统一的评测 harness。
对做长视频应用的实践者,结论是优先把算力花在「选更多更好的帧」而非压缩单帧表示上。
「多模态」频道最新
- Omni 1.1 支持视频参考:3 秒片段即可把角色一致性植入新视频 — fofrAI · 2026-09-04
- AI 生成《生化危机》×《惊魂记》恐怖恶搞短片 — No-Invite8044 · 2026-09-04
- MiniMax H3 生态一日爆发:电影感 LoRA、360° 全景、连续镜头工作流 — optimisticalish · 2026-09-04
- 基于 Gemini 的智能体视频理解实验走红,作者将开源 repo — MarioLucic_ · 2026-09-04
- Midjourney Edit 功能上手演示 — sergeantsref · 2026-09-04
- DeepLearning.AI 与 Google 推出免费课:AI 图像视频生成 Agent 与评估 — DeepLearningAI · 2026-09-04