ColQwen-Omni 支持音视频检索:查录音无需先转写

tomaarsen · x · 2026-08-18

晚交互模型正从页面图像扩展到更多非文本模态:ColQwen-Omni 接受文本、图像、音频与视频输入,检索一段录音对话只需同样两次调用,零样本且全程无需转写——查询词 "nausea" 能直接命中音频里的 "carsickness"。此前 ColPali 系列已实现文本查询直接匹配页面图像/图表,免 OCR。

所属事件:Sentence Transformers v6.0 发布,晚交互多向量模型成一等公民(33 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →