FATE 模型:突破音视频对齐瓶颈,实现帧级时间与语义双重嵌入

RUC · hf · 2026-08-10

现有的音视频模型往往难以兼顾语义匹配与时间对齐。为了填补这一空白,研究人员提出了 FATE(Frame-level Audio-visual Temporal Embedding)模型。

该研究的源代码已开源。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →