手势跟丢、该静默却抢答,视频助手基准最高 66.4

OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan

cs.CV

2026-08-22

用互联网视频逆向剪成多轮助手交互,评 11 个 Omni-LLM。Gemini-3-Pro 得 66.4,开源最高 Qwen3-Omni 51.2;手势指令、延时作答和跨轮记忆全是短板。

这篇在解决什么

传统视频理解基准把视频当静态考卷:模型答完,后面的画面不会变。真正的视频助手走另一条路。模型如果说「先打奶泡再萃取」,用户就会去打奶泡,下一段画面跟着变。同一目标能走出多条合理路径,离线数据集没法给每条路径都准备后续视频。

评测因此卡住。静态选择题测不出「边看边导」的能力,模型的回答会把交互轨迹打散。南京大学、南开大学和滑铁卢大学的 OmniAssistBench 把路径锁死,再把互联网视频剪成多轮助手交互,专门测实时视频助手。

方法

核心机制是先验知识。标注员从源视频抽出一条标准流程,例如这杯拿铁必须先萃取再打奶,发给模型当约束。模型必须沿这条路带用户走,不能另起一套同样说得通的做法。每条样本因此只有一个 ground truth 路径,评测才收得住。

数据靠逆向工程,四步:

一共 300 条视频、685 组 QA,平均时长 182 秒,标注超过 1000 专家人时。基础层覆盖社交感知、时序细节、指代消歧、非语音指令;进阶层覆盖情境建议、延时作答、多步流程跟踪。另拍了 3 个真实场景:12 人圆桌会议约 20 分钟、盲人办公导航、三人一起做手工,平均 15 轮、单条超过 16 分钟。

非时序任务视频被剪到 30–180 秒,分辨率统一约 1080p。Gemini 家族按原分辨率评,其余模型 1 帧/秒。上下文超限就 FIFO 丢掉最早的历史。系统提示要求该闭嘴时只输出 [KEEP QUIET]。

结果

闭源 Gemini-3-Pro 总分 66.4,开源最高 Qwen3-Omni-Instruct(30B-A3B) 51.2。按评分规则,现有模型大体听得懂口头指令,给不出完整正确的帮助。

模型总分基础层真实场景
Gemini-3-Pro66.463.668.0
Gemini-2.5-Pro64.665.444.8
Doubao-Seed-2.0-lite57.353.235.5
Qwen3-Omni-Instruct51.246.453.8
MiniCPM-o-4.546.044.637.8
VITA-1.524.624.614.6

手势指令是硬伤。Gesture-based Prompt Following 上 Gemini-3-Pro 55.0,豆包 29.5,Qwen3-Omni 28.2。延时作答里多事件触发(MER) Gemini-3-Pro 只有 48.4。真实场景上 Gemini-3-Pro 比 2.5-Pro 高 23.2 分,手工跟踪里小物件移出画面仍会丢;多数模型读不懂盲人任务里的手绘地图。

消融里,去掉音频或画面多数任务掉分,「延时作答」在纯视觉下反而更好:没有背景对话,模型不会把视频里的人声当成新指令。Teacher forcing 把历史换成正确答案,分数提升不明显,模型学了简短格式,仍接不上画面。分辨率从 1080p 降到 360p,能多塞约 50 秒上下文,全基准几乎没动。GPT-5、GLM-5、DeepSeek-v3.2 三个 judge 的 Pearson 相关都在 0.75 以上。

为什么重要

谁在做实时视频助手,这张表比 Video-MME 这类静态题更接近产品形态。手势听不懂、该闭嘴时抢答、跨轮忘掉最初目标,三件事现有 Omni-LLM 都没过关。开源模型离能用的助手还远;闭源刚过「部分有效」这条线。

数据构造贵。1000 人时换 300 条视频,规模上没法跟自动刷题集比。可复用的是评测方法:用先验锁路径,用剪辑模拟在线交互。

局限与存疑

路径锁死后,测的是「按给定流程带路」,不是「在开放选项里自己规划」。真实助手经常要选路。用户目标是标注员事后从视频反推的,和真人求助分布可能对不齐。真实场景只有 3 条,模型间差距方差会很大。Judge 是 GPT-5,相关高不代表没有系统性偏好。Gemini 和其他模型的帧率设定不同,分数里可能掺了输入协议差。论文没报人类表现当上限。

术语

原文与代码

相关论文

全部论文解读