AgentVidBench 发布:多跳视频 QA 测试 MLLM 空间时序因果推理
Kangwook_Lee · x · 2026-09-21
Kangwook Lee 团队在 arXiv 发布 AgentVidBench,一个面向 MLLM agent 的多跳视频问答 benchmark,重点评测空间、时间与因果推理能力。
要点:
- 现有视频 benchmark 多停留在场景级查询或全局摘要,只需单步推理;AgentVidBench 专注多跳多模态推理这一空白。
- 除标准 QA 对外,还提供逐步解题轨迹(solution traces),支持轨迹级评估——检验 agent 是否真正获取了支撑答案的证据。
- 对 12 个专有与开源 MLLM 的实验显示:单轮表现有限,接入 agentic 工作流后在准确率和轨迹得分上普遍提升。
- 趣闻:该 benchmark 源自团队内部用于开发自动化游戏 QA agent 的私有基准。
所属事件:威斯康星团队发布多跳视频问答基准 AgentVidBench(2 条相关)→
「多模态」频道最新
- Qwen-Image-2.1 无审查 GGUF 量化版登上 Hugging Face 热榜 — abenzerps · 2026-09-21
- 自研 CUDA 兼容层让 Mac 跑图反超 RTX 5090,最快快 61% — LioDavinchy · 2026-09-21
- 实测 Qwen-Image-2.1:T2I 不敌 Krea2,编辑不如 Flux2Klein 灵活 — Capitan01R- · 2026-09-21
- Reddit 实测:Qwen 2.1 图像生成与编辑被称开源的 Nano Banana 时刻 — LongjumpingGur7623 · 2026-09-21
- GPT-Image 2.5 生成 4×4 像素图,Seedance 2.5 一键动画化 — Aiden_Tech_Ai · 2026-09-21
- Qwen-Image 2.1 上线 SGLang:单张 4090 18.7 秒生成图像 — Alibaba_Qwen · 2026-09-21