MBZUAI 新方法:冻结 VLM 无需重训即可完成语音中心全模态理解

MBZUAI · hf · 2026-09-07

MBZUAI 发布 TFO(Training-Free Omni Understanding)方法,让冻结的视觉语言模型(VLM)具备以语音为中心的音视频理解能力。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →