长视频 MLLM 视觉 token 分配研究:选帧决定上限,省token应换更多帧

Prakhar Khatri · hf · 2026-09-04

该研究对长视频多模态大模型(MLLM)中的视觉 token 分配做了受控实验,核心发现:

对做长视频应用的实践者,结论是优先把算力花在「选更多更好的帧」而非压缩单帧表示上。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →