AgentVidBench 发布:多跳视频问答基准,测空间时序因果推理
Kangwook_Lee · x · 2026-09-21
威斯康星大学 Kangwook Lee 团队发布 AgentVidBench,一个面向 MLLM 智能体的多跳视频问答基准,论文已挂 arXiv、数据集上架 Hugging Face。
- 评测重点:现有视频基准多为单步推理的场景级问答,该基准专注空间、时间与因果推理的多跳多模态推理,并要求智能体逐步获取证据。
- 轨迹评估:除标准问答对外,还提供分步解题轨迹,评估智能体是否显式收集了支撑答案的证据。
- 实验结果:测试 12 个专有与开源 MLLM,单轮表现普遍有限;接入 agentic 工作流后,准确率与轨迹得分通常都有提升。
- 趣闻:该基准最初是团队开发自动化游戏开发智能体时用的内部私有基准。
所属事件:威斯康星团队发布多跳视频问答基准 AgentVidBench(2 条相关)→
「多模态」频道最新
- Qwen-Image-2.1 无审查 GGUF 量化版登上 Hugging Face 热榜 — abenzerps · 2026-09-21
- 自研 CUDA 兼容层让 Mac 跑图反超 RTX 5090,最快快 61% — LioDavinchy · 2026-09-21
- 实测 Qwen-Image-2.1:T2I 不敌 Krea2,编辑不如 Flux2Klein 灵活 — Capitan01R- · 2026-09-21
- Reddit 实测:Qwen 2.1 图像生成与编辑被称开源的 Nano Banana 时刻 — LongjumpingGur7623 · 2026-09-21
- GPT-Image 2.5 生成 4×4 像素图,Seedance 2.5 一键动画化 — Aiden_Tech_Ai · 2026-09-21
- Qwen-Image 2.1 上线 SGLang:单张 4090 18.7 秒生成图像 — Alibaba_Qwen · 2026-09-21