只看最后四帧就能追平复杂模型,StreamArena 重做小时级流式视频理解基准

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia

cs.CV

2026-08-06

小时级流式视频理解基准:243 条平均 88.8 分钟视频、3,646 道开放式问答,考四项能力。配套 StreamMind 双层架构全超流式基线、延迟降 66%。

这篇在解决什么

要把多模态 agent 部署成「常驻」形态(可穿戴设备、机器人),它得持续吞音视频流、维护小时级记忆,还能主动开口。但现在的评测大多是短片段加选择题,有分析指出一个「只用最后四帧」的极简基线就能追上甚至超过复杂的流式模型,因为答案选项本身就泄露了语言捷径。高分不代表真的理解了小时级流。

方法

StreamArena 是一个面向小时级、可交互、长程流式视频理解的基准:243 条完整长视频(平均 88.8 分钟),3,646 道经人工校验的开放式问答(草稿保留率约 73%,平均每条视频约 15 题),考四项能力:实时感知(RTP)、历史回溯(HR)、主动交互(Pro.,没人提问时自己盯)、多模态工具调用(Tool)。开放式作答,去掉了选择题的语言捷径。题量分布上历史回溯占大头,工具调用 1,732 道,主动交互 774 道,最难的题要跨 15 段证据,约两成历史题的证据在 30 分钟以前。

配套的 StreamMind 是双层架构:前端 worker 跑延迟敏感的交互和主动监控(独立调度),后端 worker 异步构建持久多模态记忆、做历史回溯和外部检索。Router、Recall、Search、Monitor 几种 worker 分工。延迟敏感的路径和记忆构建解耦,所以查询来了能直接复用已经建好的状态。

结果

能力(同 Qwen3.5-397B-A17B 骨干)最强流式基线StreamMind相对提升
实时感知 RTP44.5+58.4%
工具调用 Tool56.1+228.1%
主动交互 Pro.11.6+54.7%

池化查询到回答的延迟从 81.4 秒降到 27.5 秒(降 66.2%),同时保留 89.7% 的池化准确率。人类参考:RTP 91.8、Tool 95.2、Pro. 91.5。

需要点明一个取舍:在纯准确率上,离线的轮次式模型(Gemini 3.5 Flash 的 RTP 51.3、HR 51.4)其实比 StreamMind 高。StreamMind 赢的是「支持流式」这一档,代价是要持续维护状态、支持主动交互,绝对精度反而让位。

为什么重要

基准层面,它把流式、长程、主动、工具四件事放进同一个开放式测试,逼模型同时具备,而不是各练各的。架构层面,StreamMind 的核心判断是:持久感知和记忆构建必须挪出「回答的关键路径」,查询来了直接检索已经建好的状态。延迟下降来自状态复用,不是免费计算。

局限与存疑

开放式问答靠 Gemini 3.1 Pro 当判官打分,会引入 LLM judge 的偏差。主动交互整体极难:人类 91.5%,StreamMind 只有 11.6%,绝对水平还很低。243 条视频规模适中,覆盖有限。离线模型精度更高这条说明 StreamMind 的优势是能力覆盖加延迟,不是答得更准。

术语

原文与代码

相关论文

全部论文解读