OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs
Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan
cs.CV
2026-08-22
用互联网视频逆向剪成多轮助手交互,评 11 个 Omni-LLM。Gemini-3-Pro 得 66.4,开源最高 Qwen3-Omni 51.2;手势指令、延时作答和跨轮记忆全是短板。
传统视频理解基准把视频当静态考卷:模型答完,后面的画面不会变。真正的视频助手走另一条路。模型如果说「先打奶泡再萃取」,用户就会去打奶泡,下一段画面跟着变。同一目标能走出多条合理路径,离线数据集没法给每条路径都准备后续视频。
评测因此卡住。静态选择题测不出「边看边导」的能力,模型的回答会把交互轨迹打散。南京大学、南开大学和滑铁卢大学的 OmniAssistBench 把路径锁死,再把互联网视频剪成多轮助手交互,专门测实时视频助手。
核心机制是先验知识。标注员从源视频抽出一条标准流程,例如这杯拿铁必须先萃取再打奶,发给模型当约束。模型必须沿这条路带用户走,不能另起一套同样说得通的做法。每条样本因此只有一个 ground truth 路径,评测才收得住。
数据靠逆向工程,四步:
一共 300 条视频、685 组 QA,平均时长 182 秒,标注超过 1000 专家人时。基础层覆盖社交感知、时序细节、指代消歧、非语音指令;进阶层覆盖情境建议、延时作答、多步流程跟踪。另拍了 3 个真实场景:12 人圆桌会议约 20 分钟、盲人办公导航、三人一起做手工,平均 15 轮、单条超过 16 分钟。
非时序任务视频被剪到 30–180 秒,分辨率统一约 1080p。Gemini 家族按原分辨率评,其余模型 1 帧/秒。上下文超限就 FIFO 丢掉最早的历史。系统提示要求该闭嘴时只输出 [KEEP QUIET]。
闭源 Gemini-3-Pro 总分 66.4,开源最高 Qwen3-Omni-Instruct(30B-A3B) 51.2。按评分规则,现有模型大体听得懂口头指令,给不出完整正确的帮助。
| 模型 | 总分 | 基础层 | 真实场景 |
| Gemini-3-Pro | 66.4 | 63.6 | 68.0 |
| Gemini-2.5-Pro | 64.6 | 65.4 | 44.8 |
| Doubao-Seed-2.0-lite | 57.3 | 53.2 | 35.5 |
| Qwen3-Omni-Instruct | 51.2 | 46.4 | 53.8 |
| MiniCPM-o-4.5 | 46.0 | 44.6 | 37.8 |
| VITA-1.5 | 24.6 | 24.6 | 14.6 |
手势指令是硬伤。Gesture-based Prompt Following 上 Gemini-3-Pro 55.0,豆包 29.5,Qwen3-Omni 28.2。延时作答里多事件触发(MER) Gemini-3-Pro 只有 48.4。真实场景上 Gemini-3-Pro 比 2.5-Pro 高 23.2 分,手工跟踪里小物件移出画面仍会丢;多数模型读不懂盲人任务里的手绘地图。
消融里,去掉音频或画面多数任务掉分,「延时作答」在纯视觉下反而更好:没有背景对话,模型不会把视频里的人声当成新指令。Teacher forcing 把历史换成正确答案,分数提升不明显,模型学了简短格式,仍接不上画面。分辨率从 1080p 降到 360p,能多塞约 50 秒上下文,全基准几乎没动。GPT-5、GLM-5、DeepSeek-v3.2 三个 judge 的 Pearson 相关都在 0.75 以上。
谁在做实时视频助手,这张表比 Video-MME 这类静态题更接近产品形态。手势听不懂、该闭嘴时抢答、跨轮忘掉最初目标,三件事现有 Omni-LLM 都没过关。开源模型离能用的助手还远;闭源刚过「部分有效」这条线。
数据构造贵。1000 人时换 300 条视频,规模上没法跟自动刷题集比。可复用的是评测方法:用先验锁路径,用剪辑模拟在线交互。
路径锁死后,测的是「按给定流程带路」,不是「在开放选项里自己规划」。真实助手经常要选路。用户目标是标注员事后从视频反推的,和真人求助分布可能对不齐。真实场景只有 3 条,模型间差距方差会很大。Judge 是 GPT-5,相关高不代表没有系统性偏好。Gemini 和其他模型的帧率设定不同,分数里可能掺了输入协议差。论文没报人类表现当上限。