FATE 保留帧级时间轴:视听检索大幅领先,零样本事件定位赶上全监督

FATE: Frame-Level Audio-Visual Temporal Embedding

Kaisi Guan, Bingzi Zhang, Xihua Wang, Ying Ba, Xin Cheng, Yijing Chen, Ruihua Song

cs.MM

2026-08-02

现有视听模型要么懂语义(什么声)却丢时间,要么懂同步(何时响)却没有可复用的语义表示。FATE 保留两个模态的帧级序列、在物理时间轴上对齐、按对齐帧算相似度,用跨视频语义加视频内时间对比学习一起训。结果在时间检索上大幅领先,零样本事件定位赶上全监督方法,作为生成评估指标与人判断相关性最高。

这篇在解决什么

狗张嘴吠叫时,人自然知道「这是什么声、什么时候响」。给视听模型这个能力,需要表示同时抓住语义对齐和时间对齐。但现有方法各偏一头:嵌入模型把每个模态池化成一个向量做语义匹配,丢了时间信息;同步模型能预测时间偏移,但没有可复用的语义表示。FATE 要把这个缝补上。

方法

核心是不池化。FATE 保留两个模态的帧级 token 序列,用最近邻插值(以音频为时间锚)把它们对齐到物理时间轴上,相似度定义为「严格对齐的帧对之间内积的均值」。这样既比「是什么」又比「何时」。

训练目标有两个,合在一起:跨视频的语义对比学习(不同视频的同模态内容拉近、异类推远),以及视频内的时间软对比学习,用一个升余弦核让相邻时间偏移拿到中间强度的标签,而不是非黑即白。这避免了硬负样本造成的冲突梯度。

结果

三个任务全面领先。

时间跨模态检索(给一段音频找对应视频,或反过来),AVSync-15:

方法同视频 V2A R@3VGG-Sync 跨视频 V2A
PE-AV18.00
Synchformer38.8910.78
FATE55.7437.76

零样本事件定位(AVE 数据集,平均准确率):FATE 48.3%,超过全监督的 DAM(47.8%),远高于此前零样本的 PE-AV(31.8%)。

作为生成评估指标(与人类 MOS 的相关性):FATE 样本级相关 17.24、模型排名相关 44.41,分别优于次优的 CAVP(14.15)和 AV-Align(24.99)。

消融证明帧级设计是命门:去掉帧级结构,AVSync-15 同视频 V2A 从 55.74 掉到 29.11,跨视频从 34.13 掉到 19.33。

为什么重要

对做视听生成(视频配音、文生音视频)的人,FATE 提供了一个能同时判断「内容对不对」和「时间对不对」的统一嵌入,可直接当生成质量指标,而不用分别跑语义模型和同步模型。对视听理解(检索、事件定位),它说明「保留时间轴加双目标对比学习」是一条比全局池化更强的路线,而且零样本就能追上全监督,提示监督数据在这些任务上可能被高估了。

局限与存疑

作者承认两点:作为生成评估指标时,所有指标(含 FATE)的样本级绝对相关都不高,细粒度同步评估仍是开放问题;模型排名相关只在五个生成模型上算,只能算指示性结论。还有一点存疑:论文主打「帧级」,但帧级表示带来的计算与显存开销(相对池化模型)没在这篇里量化清楚,实际部署的成本不明。

术语

原文与代码

相关论文

全部论文解读