整段文本分把强弱模型打成五五开,结构约束下变成74.2对25.8

OmniCapBench: A Deep-Structured Evaluation Framework for Fine-Grained Audio-Visual Captioning

Zhongyu Yang, Jiale Tao, Ruitao Chen, Zuhao Yang, Yingfang Yuan, Xueliang Zhao, Auden, Kai Wang, Shuai Shao, Biao Wang, Steve Yves, Qinglin Lu

NeurIPS 2026

cs.CV

2026-10-09

786条视频上,OmniCapBench把音视频描述拆成可核验的原子单元,规则查结构、LLM只比局部语义。文本分约50对50时,结构分变成74.2对25.8,跨镜头身份一致性最高37.81%。

这篇在解决什么

音视频描述的分数,现在仍从两种单元来。整段字幕交给一个 LLM 法官,覆盖全片,认错人、时间滑了、声音挂错画面,都压成一个看不出位置的分数。填空和问答探针能指出局部错误,题目稀,同一个探针换法官就可以翻盘。LongVALE、TimeChat 先把自由文本解析成事件再打分,解析错一步,分数跟着错。

单元若是一整段话,法官就得在同一次调用里抽取、对齐、比较,措辞和事实缠在一起。OmniCapBench 来自腾讯混元,进了 NeurIPS 2026 评测与数据集赛道。它把模型要交的东西改成原子单元,人、镜头、声音各一条。规则查结构,LLM 只比已经对齐的短字段。

方法

底稿是混元的 Multi-Stream Scene Script,实体、声音、画面三条流。镜头再拆成 subshot,时间点改成连续区间。References 给人、物体、场景发持久 ID。Events 收听觉事件和对白,带起止时间。Shots 切视觉时间轴,把人和声音挂到镜头上,给另外两轨当锚。

入选视频要有音轨,时长不超过 5 分钟,并过每分钟镜头和事件的密度门槛。生成按 References、Events、Shots 的顺序循环:生成、程序校验、只改文字、再挑选。改写时锁死 ID、时间和跨轨链接,免得润色写出新幻觉。帧角的红色时间戳只给标注看,评测用原片。

模型交三轨 JSON,温度 0,上限 4096 token。JSON 不合法就过不了 SGC,这条视频后面的指标记 0。规则先丢掉非法 ID、起止颠倒、时间对不上的事件与镜头链接。对齐阈值固定:镜头 tIoU 不低于 0.30,非对白事件不低于 0.20,对白看 1 减词错误率,门槛 0.50。身份和 subshot 只比较局部外观描述,LLM 只判断对齐字段的语义等不等价。

同一个动作,标注可以是一个 subshot,模型可以拆成三个,两边都可能是事实。References 和 subshot 因此双向计分,recall 罚漏写,precision 罚编造,F1 取调和平均。

一共 786 条、12.8 小时,全部有音轨,只有测试集。时长中位数 28.32 秒,均值 58.82 秒。1 分钟内 482 条,占 61.32%;1 到 3 分钟 228 条;3 到 5 分钟 76 条。平均每条 7.40 个实体、14.53 个镜头、49.82 个 subshot、8.32 个声音事件,其中对白 6.83 个。一级类目 20 个,二级 125 个。

结果

规则分按视频做宏观平均,表内为百分数。

模型SGCCCCRef Subject F1Event F1EVSASpeaker F1
Gemini 3.1-Pro97.3634.4378.6063.3251.4691.18
Gemini 2.5-Pro96.7337.8180.7058.5243.7489.72
Qwen3.5-Omni-Plus96.0929.5573.5753.9240.2091.20
Qwen3.5-Omni-Flash95.5824.3172.2750.6835.5889.91
Seed2.087.6831.8865.294.543.5291.80
MiMo-2.596.5823.9161.1943.8231.6986.62

闭源 SGC 大多在 95 以上,格式错误只占 Gemini 3.1-Pro 失败的 1.3%。身份是缺口。Gemini 2.5-Pro 的 Ref Subject F1 为 80.70,1 分钟内子集 84.80,CCC 掉到 37.81;Gemini 3.1-Pro 为 78.60 和 34.43。Qwen3-Omni-Instruct、Qwen3-Omni-Captioner、MiniCPM-o-2.6 的 CCC 是 9.85、11.51、4.29,SGC 仍有 89.02、90.77、72.13。单镜头认得出人,切镜之后 ID 接不上。

声音挂到画面上比检出声音更难。Gemini 3.1-Pro 的 EVSA 为 51.46,低于它的 Event F1 63.32。开源模型的 EVSA 落到 13.33、17.42、2.46,没有一家超过 20。对白语义不低于 80%。Seed2.0 的 Speaker F1 有 91.80,Event F1 只有 4.54,说话人分只覆盖它写下的对白。

六家闭源的 subshot tIoU 挤在 46.51 到 49.18。镜头级还能分开,Shot F1 上 Gemini 3.1-Pro 为 76.24,2.5-Pro 为 70.93。

语义分只打在已经对齐的单元上。Gemini 3.1-Pro 写人偏保守,precision 67.07,recall 43.78。MiniCPM-o-2.6 场景 precision 76.32,recall 20.39。Gemini 3.1-Pro 的失败里,动作幻觉占 28.5%,音画挂错占 23.7%,声音幻觉占 17.9%。

换法官,整段协议从 71.24 漂到 93.92,三个法官依次是 Qwen3.6-27B、GPT-4o、Gemini-2.5-Pro。问答式 Omni-Cloze 为 61.17、53.49、56.57,强法官没有给出更高分。本基准把 LLM 限制在局部语义,三个法官是 56.82、58.24、57.60。

另有 200 条来自 UGC-VideoCap 和 video-SALMONN 2,专选 Qwen3.5-Omni-Flash 对 Qwen3-Omni、Plus 对 Flash 在文本指标上大约 50 对 50 的片子。加上结构约束,较强一侧到 74.2,与人工审计对齐,较弱一侧到 25.8。Qwen3.5-Omni-Plus 给吹叶机操作者编了一副护目镜,整段话仍然通顺。ASID-Caption 和 AVoCaDO 未进主表,自由文本微调之后跟不上 JSON 指令。

为什么重要

闭源模型的 schema 已经很高,分差集中在跨镜头身份和音画挂接。字幕总分会把写得顺的模型排到保住 ID 的模型前面。74.2 对 25.8 就是文本分打平之下的距离。

模型必须交三轨 JSON。栽在 SGC 上的 0 分,不能当成画面没看懂。主表里格式失败占比很小,剩下的差距更接近感知。论文没有证明用这套格式去训练,CCC 就会上去。

局限与存疑

摘要里的 long-horizon,对应中位数 28.32 秒的片子,61% 短于 1 分钟,最长 5 分钟。跨镜头身份在这个长度上就断,这是真缺陷。用它衡量十分钟以上的长视频,证据不够。

正文没有标注者间一致率。参考答案来自多模型起草再加人工修订。subshot 怎么切、噪声算不算事件,可能带着生成模型的切分习惯。同族模型是否因此占便宜,没有测量。

语义判断仍由 LLM 做出。三个法官下总分几乎不动,压住的是「法官越强,分越高」这一类漂移。与人工对齐的 74.2 只来自那 200 条文本分打平的视频。

标注没覆盖到的说法不直接扣主 precision。没标到的真细节不会被罚,一部分没被接住的胡编也会从主分里漏出去。

输出上限 4096 token,每条平均约 50 个 subshot,recall 里分不清没看见和写不下。匹配门槛没有敏感度实验。非对白事件的 tIoU 放到 0.20,Gemini 3.1-Pro 的 Event tIoU 可以到 71.92,Event F1 仍是 63.32。按视频平均时短片占 482 条,权重大。CCC 和 EVSA 随时长怎么变,主文没有表。

术语

原文与代码

相关论文

全部论文解读