EmbeddingGemma 2 多模态搜索演示:一次检索图视频音频
tomaarsen · x · 2026-10-07
tomaarsen 展示了他心目中的多模态 embedding 搜索最佳演示:输入「Birds」即可同时检索出鸟类的图片、视频甚至音频片段,也可以直接用图片或声音作为查询。
- 模型:Google DeepMind 昨日发布的 EmbeddingGemma 2
- 全部在浏览器端通过 WebGPU 运行,无需服务器
- 模型已在 Hugging Face 开源(google/embeddinggemma-2),支持 text/image/video/audio 特征提取,上线首日获 600+ 点赞
所属事件:EmbeddingGemma 2 演示文本一搜即得图片视频音频(2 条相关)→
「多模态」频道最新
- Kandinsky 6.0 视频模型 MIT 开源:RTX 4090 约 7 分钟生成 5 秒带声视频 — lmoroney · 2026-10-07
- LTX-2.5 修复 LoRA:240p 糊视频重生为 720p 清晰画面 — multimodalart · 2026-10-07
- 格拉茨理工与华为推出神经发射场,实时渲染复杂光源 — ssh4net · 2026-10-07
- 无需 Houdini 功底:Blender 城市生成器插件可程序化搭建夜景与交通 — bilawalsidhu · 2026-10-07
- MiniCPM-V-4.7-35B-A3B 悄然现身 Hugging Face,尚未发布模型卡 — BreakfastFriendly728 · 2026-10-07
- 用 Opus 5.5 + Higgsfield 做电商产品展示动画 — Tegadesigns · 2026-10-07