ColQwen-Omni 支持音视频检索:查录音无需先转写
tomaarsen · x · 2026-08-18
晚交互模型正从页面图像扩展到更多非文本模态:ColQwen-Omni 接受文本、图像、音频与视频输入,检索一段录音对话只需同样两次调用,零样本且全程无需转写——查询词 "nausea" 能直接命中音频里的 "carsickness"。此前 ColPali 系列已实现文本查询直接匹配页面图像/图表,免 OCR。
所属事件:Sentence Transformers v6.0 发布,晚交互多向量模型成一等公民(33 条相关)→
「编程与Agent」频道最新
- 利用 AI Agent 整理证据集并生成发布报告实战 — CodeByPoonam · 2026-08-19
- 开发者多开三个 Codex 账号加一个 Claude 账号跑并行智能体 — ChanceKelch · 2026-08-19
- DeepSeek 开源 Agent 框架,Star 破 13 万 — alex_verem · 2026-08-19
- 并行任务用云 Agent 省心省电:开发者实测对比本地方案 — brandon_galang · 2026-08-19
- 研究称模型能检测欺骗并学会忽略,多智能体对齐受关注 — logangraham · 2026-08-19
- IBM Bob 实测 SWE-bench:解决 60.6% 真实 bug,单任务成本约 1 美元 — TejasKumar_ · 2026-08-19