26选1多跳视频问答,单轮最强模型也只答对51%

AgentVidBench: A Multi-Hop Video Question Answering Benchmark for Evaluating MLLM Agents

Seoyeon An, Hyeonseo Jang, Minsu Kim, Chanho Lee, Younghan Park, Kangwook Lee

cs.CV, cs.AI

2026-09-18

KRAFTON发布多跳视频问答AgentVidBench:71条最长27分钟的视频上100道26选1题,单轮最强Gemini 2.5 Pro答对51%,接Video-ReAct后到58%,STAR框架几乎全面拉低分数。

这篇在解决什么

现有视频问答基准大多是「看一遍、答一题」。Video-MME、EgoSchema 这类评测测的是单轮感知:给模型一段视频,一次前向就能交差。人看视频不是这样。会倒回去找某个镜头、放大一块字幕、把前后两段事件串起来。

KRAFTON 这组人认为,固定深度的 Transformer 在一次前向里算不完 k 跳依赖推理。他们把这个限制写成一条推论,然后专门造一套必须主动搜证据才能做对的题。AgentVidBench 评的是会不会像人一样翻视频,不是看过这段没有。

方法

基准很小但做得很重:71 条公开授权视频、100 道选择题。视频从 8 秒到 27 分钟,中位数大约 5.5 分钟,覆盖日常生活、纪录片、体育表演、屏幕录制等 12 个细类。每题 26 个选项(A 到 Z),瞎蒙期望只有 3.85%。出题时禁止单帧可解,也禁止靠局部时间戳直接查到答案。

每道题走人工共识:三个标注员独立作答,对不上就改题,直到只有一个可验证答案。再配 25 个干扰项,数字题给邻近整数,文本题给视频里出现过的近义候选,有时还塞「视频里没提到」这类陷阱。难度分布是 13 易、28 中、29 难、30 极难,每题平均绑 3.75 个细技能。

更关键的是 milestone:标注员先写一份人类翻视频的推理笔记,再抽成「需要拿到什么证据」的步骤,刻意不绑定具体工具。评轨迹时用 LLM judge 打五个维度:任务理解、证据覆盖、证据落地、证据完整、推理忠实,再合成一个轨迹分。不同 agent 框架可以走不同工具路径,只要拿到了该拿的证据就算覆盖到。

他们自己给了一个轻量基线,叫 Video-ReAct。规划器用 ReAct 循环,最多 20 步、15 次工具调用,手里两把工具:analyzevideo(起止时间、fps 1–20、分辨率、关注区域,底层统一用 Gemini 2.5 Pro 看画面)和 gettranscript(Whisper-large-v3 预先抽的字幕)。对照框架包括 STAR(时空工具交替调度)、DVD(多粒度检索)和 AVP(主动感知加反思)。

结果

单轮最强是 Gemini 2.5 Pro,准确率 51%,轨迹分 0.71。GPT-5 单轮只有 29%,Claude Opus 4.7 是 30%。开源侧 Gemma-4-31B 单轮 38%,多数 Qwen3-VL / Qwen3.5 落在 16%–25%。

接上 agent 框架之后,结果分化很大。STAR 几乎全面拉低准确率:GPT-5 从 29% 掉到 14%,Gemini 2.5 Pro 从 51% 掉到 13%。工具识别不够强时,多步规划会把单轮模型自己能看懂的东西搞砸。

Video-ReAct 是这张表里最稳的加分项:

模型单轮准确率Video-ReAct
Gemini 2.5 Pro51%58%
Claude Opus 4.730%54%
GPT-529%49%
Qwen3.5-27B22%49%
Gemma-4-E4B16%51%

AVP 在 Gemini 2.5 Pro 上到 56%,token 效率最高(准确率除以百万 token 为 5.28),Video-ReAct 是 3.76,单轮是 3.36。精度最高的方案并不是最省 token 的。消融里拿掉 fps、分辨率或时间窗控制,Video-ReAct 会从 58% 掉到 50%–56%,时间窗和 fps 掉得更明显。

为什么重要

做视频 agent 的人现在缺的是「必须翻视频才能做对」的考题。这套基准把答案正确和证据轨迹拆开打分,能看出模型是真的找到了镜头,还是蒙对了 26 选 1。Video-ReAct 的启示很具体:给规划器自己选看哪一段、用多细的 fps,比套一套固定的 plan-observe-reflect 流水线更有效。

规模只有 100 题。它更接近诊断集,不是排行榜燃料。

局限与存疑

作者自己承认两点:必须用开放授权视频,加上人工写多跳题和校验轨迹,所以做不大。难度档位还掺了现有模型的实测分数,有循环标定的味道。

轨迹分靠 LLM judge。论文用 MINERVA 的 MiRA 做过对照,说工具日志格式不同会被误罚,所以改成与工具无关的 milestone。judge 本身的偏差没有用大规模人类重标来钉死。26 个选项压低了瞎蒙,但 100 题的置信区间不会很窄。STAR 崩得那么狠,也可能是工具实现和原论文设定不完全对齐,不完全能怪框架本身。

术语

原文与代码

社区讨论

相关论文

全部论文解读