Weaviate 演示用 Gemini Embedding 2 直接检索音频
eshorten300 · x · 2026-07-28
Weaviate 给出了一份 notebook,演示如何不依赖转写稿,直接对音频本身做检索。
核心流程是:
- 将原始音频切成重叠片段
- 用 Gemini Embedding 2 生成多模态向量
- 把音频片段存入 Weaviate 并建立检索
- 通过文本或音频查询找回相关片段
- 再用 Gemini 3 Flash 基于检索结果生成答案
示例素材是 Robert Frost 的《Birches》,但作者明确表示同样的方法可用于播客、访谈、讲座和通话录音。
「多模态」频道最新
- Krea2 局部重绘工作流:LanPaint 配合差分扩散 — Altruistic_Tax1317 · 2026-07-29
- Linus Ekenstam 说,Mirage Avatar X 可用 10 秒视频克隆分身 — LinusEkenstam · 2026-07-29
- Scobleizer 说,AI 分身可让创作者一次录制后用 39 种语言出镜 — Scobleizer · 2026-07-29
- Mirage 的 Avatar X 号称 10 秒视频就能生成数字分身 — Scobleizer · 2026-07-29
- Avatar X 被赞能让表情跟上非语言音频 — Scobleizer · 2026-07-29
- 资深科技记者称 Avatar X 抬高了 AI 头像门槛 — Scobleizer · 2026-07-29