EmbeddingGemma 2 实测:740M 参数打通图文音视频统一向量检索
Prompt Engineering · youtube · 2026-10-07
YouTube 频道 Prompt Engineering 发布 EmbeddingGemma 2 深度教程。该模型由 Google DeepMind 推出,740M 参数、Apache 2.0 开源,将文本、代码、图像、视频和音频放入同一向量空间,小到可在手机上运行。
- 原理讲解:模态编码器 + 共享 Gemma 4 主干、mean pooling、对比学习训练、Matryoshka 嵌入(可缩小向量)、模块化加载(270M-740M)。
- 对比旧方案:caption-and-transcribe 流水线、CLIP、ImageBind、ColPali。
- Colab 实操(免费 T4 GPU 即可):语音搜照片、多语言搜索、免转写语音搜索、声音搜索、视频片段定位、免 OCR 检索 PDF 页面。
附完整 Colab notebook 与模型卡链接,可今天上手复现全部 demo。
「多模态」频道最新
- 用 MiniMax-H3 在 ComfyUI 免费生成透明背景视频 — solomars3 · 2026-10-07
- OBVPM 时间线工作流两法破解 AI 视频质量退化 — obvpm · 2026-10-07
- Z-Image GGUF 量化实测:Q4_K+Qwen3-4B 塞进 8GB 显存 — Kordeyl · 2026-10-07
- H3 Inpainting + LTX Matte LoRA 视频换背景工作流,效果惊艳 — linoy_tsaban · 2026-10-07
- 用 fal 生成致敬埃舍尔《天空与水》的视错觉艺术 — OdinLovis · 2026-10-07
- MIT 等提出 IR4RL:用中间图像渲染给视觉生成模型密集 RL 奖励 — CSProfKGD · 2026-10-07