OmniSearch 把文本图片音频视频放进同一检索空间
victorialslocum · x · 2026-07-21
为什么统一多模态搜索有用
OmniSearch 展示了一个把文本、图片、音频、视频放进同一语义空间的检索玩法:文本可以搜到音频或视频,图片也能反向找到相关内容。
核心思路
它不是先把所有内容都转成文字再搜,而是直接把原始媒体做向量化:
- 播客可以不依赖转写直接检索
- PDF 页面可按图片索引,更好保留版式和图表
- 视频里即使旁白很模糊,也能找到具体动作片段
- 检索出的媒体还能直接喂给多模态生成模型
代价与限制
作者也提醒了实际成本:音频和视频需要切块,大向量存储开销很高;如果语料本来就是纯文本,文本嵌入通常更便宜、更合适。
原帖还附了 demo 和 notebooks。
「多模态」频道最新
- Sonilo 在 fal 上线 1.0,支持视频和文本生成音效 — JaynitMakwana · 2026-07-22
- MIT 提出 AI 扩散模型加速算法,斩获 ICML 杰出论文奖 — MIT_CSAIL · 2026-07-22
- 阿里 Qwen-Image-3.0 发布:单次生成可渲染 10 像素清晰文字 — The Decoder · 2026-07-21
- LTX 2.3 视频生成实测:复杂场景表现惊艳 — funeralbot · 2026-07-21
- 用 Seedance 模型生成「舒适圣诞」Lofi 动画 — nolanspredecessor · 2026-07-21
- AI 生成中短篇电影预告:《影月与狼之歌》 — AspectZealousideal43 · 2026-07-21